Большинство компаний, полностью сосредоточившихся на создании моделей ИИ, скупают все доступные им ускорители ИИ от Nvidia, но Google выбрала иной подход. Большая часть ее облачной инфраструктуры ИИ основана на собственной линейке тензорных процессоров (TPU). После анонса TPU Ironwood седьмого поколения в 2025 году компания перешла к восьмому поколению, но это не просто более быстрая итерация того же чипа.
Новые TPU представлены в двух вариантах, предлагая Google и ее клиентам более быструю и эффективную платформу ИИ, как заявляет компания. Google продвигает идею о том, что «эпоха агентов» фундаментально отличается от предшествующих систем ИИ, что требует нового подхода к аппаратному обеспечению. Поэтому инженеры разработали TPU8t (для обучения) и TPU 8i (для инференса).
Прежде чем модели ИИ станут чем-то, что можно использовать для анализа данных или создания забавных мемов, их необходимо обучить. TPU 8t был специально разработан для этого этапа жизненного цикла ИИ, чтобы сократить время обучения передовых моделей ИИ с месяцев до недель.
Обновленные кластеры серверов Tensor 8t, которые Google называет «подами» (pods), теперь вмещают 9600 чипов с двумя петабайтами общей высокоскоростной памяти. Google утверждает, что TPU 8t может масштабироваться даже линейно, до миллиона чипов в одном логическом кластере. Именно такие инновации делают супербольшие модели ИИ намного быстрее, одновременно повышая цены на ОЗУ для всех остальных. Но если вы занимаетесь созданием этих гигантских моделей ИИ, все это оборудование экономит время, обеспечивая впечатляющие 121 FP4 EFlops вычислительной мощности на под. Это почти в три раза выше предела вычислительной мощности для обучения у Ironwood.
,
Таким образом, новые чипы обеспечивают более быстрое обучение, но Google также заявляет, что вы получаете больше полезных вычислений на каждый вольт, подаваемый на TPU 8t. Компания заявляет о «хорошем» показателе вычислений (goodpute) в 97 процентов, что означает меньше ожидания и напрасных усилий. Благодаря лучшему управлению нерегулярным доступом к памяти, автоматической обработке сбоев оборудования и телеметрии в реальном времени по всем подключенным чипам, TPU 8t тратит больше времени на активное продвижение обучения модели.
Когда обучение завершено, модели ИИ работают в режиме инференса для генерации токенов — это процесс, происходящий за кулисами, когда вы даете модели команду что-либо сделать. Это не требует такой большой мощности, поэтому использование одного и того же оборудования для обеих частей жизненного цикла ИИ неэффективно. Именно поэтому инференс является прерогативой TPU 8i, который разработан для более эффективной работы с несколькими специализированными агентами, с меньшим временем ожидания. Чипы TPU 8i также работают в более крупных подах по 1152 чипа по сравнению с 256 для кластеров инференса Ironwood предыдущего поколения. Это дает 11,6 EFlops на под, что значительно ниже, чем у подов TPU 8t.

Google утроила объем SRAM на кристалле для каждого TPU 8i до 384 МБ. Это позволяет новым чипам компании хранить больший кэш «ключ-значение» на кристалле, ускоряя работу моделей с более длинными контекстными окнами. Ускорители ИИ восьмого поколения также являются первыми от Google, которые полностью полагаются на собственный ЦП Axion ARM от Google, с одним ЦП на каждые два TPU. В Ironwood каждый ЦП x86 обслуживал четыре чипа TPU. Google заявляет, что такой «полностековый» подход на базе ARM обеспечивает гораздо большую эффективность.
Игра на эффективность
Логично, что эффективность является основной частью новой конфигурации TPU от Google. Обучение и запуск передовых моделей ИИ дороги, а окупаемость инвестиций неясна. Компании продолжают тратить деньги на генеративный ИИ в надежде, что эффективность когда-нибудь переломит ситуацию. Возможно, новые TPU от Google помогут достичь этого, а может и нет, но компания добилась заметных улучшений.
,
Системы генеративного ИИ потребляют много энергии, что часто называется одной из основных причин отказа от их использования. TPU восьмого поколения не то чтобы потребляют мало энергии, но Google заявляет, что чипы обеспечивают вдвое большую производительность на ватт по сравнению с Ironwood. Google также хвастается улучшениями в своих центрах обработки данных, которые, по-видимому, «совместно разработаны» с TPU. Такие функции, как интеграция сетевых возможностей с вычислениями на одном чипе и более эффективная компоновка подов, по сообщениям, увеличили вычислительную мощность на единицу электроэнергии в шесть раз. Конечно, это не означает, что центры обработки данных будут потреблять меньше энергии, это просто означает, что они получают больше вычислений за всю потребляемую ими энергию.
Использование воды для охлаждения центров обработки данных также является серьезной проблемой эффективности. Тепло, выделяемое плотными вычислительными требованиями серверов ИИ, не может быть рассеяно воздухом, поэтому жидкостное охлаждение — единственный выход. Google адаптировала свою систему жидкостного охлаждения четвертого поколения к новым чипам, используя клапаны с активным управлением для регулировки потока воды в зависимости от рабочей нагрузки. Опять же, это должно быть более эффективно.

TPU 8t и TPU 8i будут питать агентов Google на базе Gemini в будущем, но они также разработаны с учетом сторонних разработчиков. Оба новых TPU поддерживают фреймворки, которые разработчики уже используют, включая JAX, MaxText, PyTorch, SGLang и vLLM.
После анонса Google акции Nvidia ненадолго упали примерно на 1,5 процента, но с тех пор восстановились и снова превысили 200 долларов за акцию. Стремительный рост спроса на ускорители ИИ более чем удвоил стоимость Nvidia за последний год, а рост Google оказался еще больше. Такова природа потенциального пузыря ИИ. Конечно, компании, которые получают от этого наибольшую выгоду, не считают это пузырем — они видят в этом начало эры агентного ИИ.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Ryan Whitwam




