Ключевая цель разработки — добиться шести-десятикратного увеличения числа генерируемых токенов на единицу потреблённой электроэнергии по сравнению с текущими ИИ-чипами Google. Речь идёт именно об инференсе — этапе обработки пользовательских запросов уже обученной нейросетью. Именно на инференс приходится основная доля вычислительных мощностей и, соответственно, расходов на электричество. Потенциальный десятикратный рост эффективности способен фундаментально изменить экономику генеративного искусственного интеллекта: обслуживание сложных запросов обойдётся в разы дешевле сегодняшних затрат.
Достичь столь значительного скачка производительности Google намерена не за счёт простого форсирования тактовых частот, а благодаря глубокой интеграции программного обеспечения и аппаратного обеспечения. По данным источников, компания внедряет часть нейросетевой архитектуры Gemini непосредственно на физический уровень микросхемы.
Такой подход — аппаратное кодирование ИИ-алгоритмов — позволяет устранить избыточные вычисления и свести к минимуму постоянную передачу данных между серверами. Именно эти операции при высоких нагрузках потребляют колоссальные объёмы энергии. В Google подтверждают стратегическую важность совместного проектирования «железа» и «софта» с нуля, называя это ключом к достижению максимальной производительности системы.
