Google, по слухам, разрабатывает чип «Frozen v2» с впечатанной в кремний архитектурой Gemini.

Google Frozen V2 ии-чип Tpu Gemini инференс tomshardware.com

Узнайте о серверном чипе Frozen v2 от Google, встраивающем архитектуру Gemini прямо в кремний. Оцените прирост в 6–10 раз больше токенов на ватт по сравнению с TPU и снижение задержек для новых ИИ-приложений. Поймите, как Google обходит дефицит ИИ-вычислений и готовит запуск к 2028 году.

Google разрабатывает серверный чип, неофициально называемый «Frozen v2», который будет встраивать часть архитектуры своей модели Gemini непосредственно в кремний, согласно отчету, опубликованному в понедельник изданием The Information со ссылкой на двух человек, непосредственно знакомых с вопросом. Инженеры проекта прогнозируют, что чип сможет обрабатывать в шесть-десять раз больше токенов на единицу энергии, чем новейшее поколение TPU Google, а развертывание запланировано уже на 2028 год. Два источника сообщили, что проект частично является ответом на острую нехватку вычислительных мощностей для ИИ, из-за которой Google Cloud отклоняла сделки с внешними заказчиками.
TPU, как и GPU, выполняет любую загруженную на него модель, что означает, что оборудование принимает ресурсоемкие решения во время выполнения при взаимодействии с каждой моделью. Frozen v2 зафиксирует часть этих решений для Gemini на уровне транзисторов, сокращая количество шагов, которые выполняет чип, и объем данных, передаваемых за запрос. По словам одного из источников, это может снизить задержку ответа настолько, чтобы сделать возможными новые приложения.
Оригинальная конструкция Frozen, которую возглавлял главный научный сотрудник Google DeepMind Джефф Дин, пошла дальше и предполагала встраивание самих весов Gemini в чип. Google отложил это предложение, поскольку кремний, привязанный к одной версии модели, имел бы слишком короткий жизненный цикл, сообщается в отчете. Frozen v2 «замораживает» архитектуру, оставляя веса обновляемыми, поэтому чип остается полезным для разных версий Gemini, но только до тех пор, пока Google строит их на одной и той же базовой архитектуре. Какая часть модели будет зафиксирована, по сообщениям, еще не решено.
Google не планирует производить Frozen v2 в объемах TPU и рассматривает это поколение отчасти как пробный запуск более специализированного кремния по мере стабилизации дизайна моделей. Чип будет работать вместе с линейкой TPU, а не заменять ее — линейка разделилась на отдельные варианты для обучения и инференса с восьмым поколением, анонсированным на Cloud Next в апреле. Целевой 2028 год также совпадает с годом, когда Google, по сообщениям, заказал у Intel упаковку более 3 миллионов TPU.
Кремний с аппаратно зашитой логикой инференса уже существует в демонстрационных образцах. Taalas, стартап из Торонто, привлекший более 200 миллионов долларов от инвесторов, включая Quiet Capital и Fidelity, запустил свой чип HC1 в феврале с постоянно встроенной Llama 3.1 8B на кристалле площадью 815 мм², изготовленном по техпроцессу N6 от TSMC. Компания заявляет о 17 000 токенов в секунду на пользователя без использования HBM на подложке. Тем временем Nvidia заключила сделку на 20 миллиардов долларов в декабре на лицензирование технологии Groq, разработчика чипов для инференса.
Google пока не подтвердил проект: представитель компании сообщил The Information, что не каждый проект доходит до производства и что «это тщательное исследование является центральным элементом нашего подхода полного стека».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: