Google представила TPU восьмого поколения: два специализированных чипа для обучения и инференса

Google Tpu ии обучение инференс Axion datacenterdynamics.com

Google представила TPU 8-го поколения (TPU 8t и 8i) со «специализированными архитектурами», созданными для поддержки обучения моделей и рабочих нагрузок инференса ИИ, обещая значительный прирост производительности и эффективности. — datacenterdynamics.com

Google представила восьмое поколение своих тензорных процессоров (TPU), состоящее из двух чипов, предназначенных для рабочих нагрузок обучения и инференса ИИ.

Оборудование, получившее названия TPU 8t (для обучения) и TPU 8i (для инференса), было разработано в партнерстве с Google DeepMind и имеет «специализированные архитектуры» для поддержки обучения моделей, разработки агентов и рабочих нагрузок инференса.

«Наши TPU восьмого поколения — это кульминация более чем десятилетнего развития», — заявил Амин Вахдат, старший вице-президент и главный технолог Google по ИИ и инфраструктуре. «Ключевой вывод, лежавший в основе первоначальной конструкции TPU, остается актуальным и сегодня: путем настройки и совместной разработки кремния с оборудованием, сетевыми технологиями и программным обеспечением, включая архитектуру моделей и требования приложений, мы можем обеспечить значительно более высокую энергоэффективность и абсолютную производительность».

TPU для обучения

В сообщении в блоге с подробным описанием новых TPU Вахдат охарактеризовал TPU 8t как «мощный инструмент для обучения», созданный для того, чтобы «сократить цикл разработки передовых моделей с месяцев до недель».

Один суперкластер TPU 8t может масштабироваться до 9600 чипов, предлагая два петабайта высокоскоростной памяти (HBM) и удвоенную пропускную способность между чипами по сравнению с предыдущим поколением, Ironwood. Google заявила, что архитектура обеспечивает 121 экзафлопс вычислительной производительности FP4 для преодоления узких мест пропускной способности памяти, сохраняя при этом точность для больших моделей, при этом вычислительная производительность на кластер почти утраивается по сравнению с Ironwood.

,

TPU 8t имеет двунаправленную пропускную способность масштабирования 19,2 Тбит/с и пропускную способность сетевого подключения для масштабирования наружу 400 Гбит/с, при этом Google представила новую сетевую архитектуру для поддержки оборудования. Названная Virgo Network, она, по словам компании, поддерживает четырехкратное увеличение пропускной способности центра обработки данных и построена на коммутаторах с высокой степенью радикальности, которые уменьшают количество сетевых уровней.

Кроме того, с помощью JAX и Pathways Google теперь может масштабироваться до более чем 1 миллиона чипов TPU в одном кластере обучения, при этом Virgo Network способна соединять более 134 000 чипов TPU 8t с пропускной способностью до 47 петабит в секунду неблокирующей бисекционной пропускной способности в единой структуре. В результате эта структура обеспечивает более 1,6 миллиона экзафлопс с почти линейным масштабированием производительности, как заявила компания.

Google также внедрила в TPU 8t технологии TPUDirect RDMA и TPU Direct Storage. TPUDirect RDMA обеспечивает прямую передачу данных между памятью и сетевыми адаптерами (NIC), минуя центральный процессор хоста и DRAM для снижения задержек. В то же время TPU Direct Storage также обходит центральный процессор хоста, обеспечивая прямой доступ к памяти между TPU и высокоскоростным управляемым хранилищем, «эффективно удваивая пропускную способность для массовой передачи данных», как утверждала компания.

TPU для инференса

TPU 8i, для сравнения, был создан для обработки «сложной, совместной, итеративной работы множества специализированных агентов», которые появляются с появлением агентного ИИ.

Разработанный с большей пропускной способностью памяти для обслуживания рабочих нагрузок инференса с чувствительностью к задержкам, TPU 8i масштабируется до 1152 чипов в одном кластере. Он обеспечивает 11,6 экзафлопс вычислительной производительности FP8, с общей емкостью HBM 331,8 ТБ на кластер и двунаправленной пропускной способностью масштабирования 19,2 Тбит/с на чип.

,

Google заявила, что в случае с TPU 8i она также «переработала стек», включив четыре возможности, которые устраняют эффект «зала ожидания» — когда пользовательские запросы намеренно ставятся в очередь или задерживаются для максимального использования оборудования.

К ним относятся объединение 288 ГБ HBM с 384 МБ встроенной SRAM, чтобы процессоры не простаивали; удвоение физических хостов ЦП на сервер за счет перехода на собственные ЦП Google на базе Arm Axion; удвоение пропускной способности интерконнекта для моделей Mixture of Expert; и снижение задержек на кристалле до 5 раз за счет внедрения нового встроенного механизма ускорения коллективных операций (Collectives Acceleration Engine).

Следовательно, Вахдат заявил, что эти инновации позволяют TPU 8i обеспечить на 80 процентов лучшую производительность на доллар по сравнению с Ironwood.

И TPU 8t, и 8i работают на хосте ЦП Google на базе Arm Axion и поддерживают технологии жидкостного охлаждения. Компания заявила, что также оптимизировала эффективность во всем стеке, чтобы обеспечить интегрированное управление питанием, которое может регулировать энергопотребление в зависимости от спроса в реальном времени, что приводит к улучшению производительности на ватт до 2 раз по сравнению с Ironwood.

«Владея всем стеком, от хоста Axion до ускорителя, мы можем оптимизировать системную энергоэффективность способами, которые просто недостижимы, когда хост и чип разрабатываются независимо», — сказал Вахдат.

Оба чипа станут общедоступными позднее в этом году и могут использоваться в составе Google AI Hypercomputer — облачной суперкомпьютерной архитектуры, запущенной компанией в 2023 году, которая сочетает в себе аппаратуру, оптимизированную по производительности, открытое программное обеспечение, фреймворки машинного обучения и гибкие модели потребления.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: