OpenAI назвала системы Cerebras (партнера AMD по Helios) «невероятными» для инференс-задач — AMD сделала правильную ставку

Amd Cerebras Helios инференс Wafer-Scale Engine Openai wccftech.com

Узнайте, почему AMD выбрала Cerebras для Helios: исследователь OpenAI в восторге от скорости инференса. Партнерство обещает 5x токенов на ватт. Читайте о преимуществах Wafer-Scale Engine и влиянии на прибыльность ЦОД.

AMD, похоже, весьма разумно выбрала партнера для усиления возможностей инференса своей стоечной системы Helios: недавно исследователь OpenAI буквально пропел дифирамб в пользу Wafer-Scale Engine от Cerebras.

Исследователь OpenAI о возможностях чипов партнера AMD Helios, Cerebras: «Они невероятны, потому что обеспечивают такой быстрый инференс»

Как мы недавно объясняли в отдельной статье, Helios — это первое полноценное стоечное решение AMD для AI-нагрузок, состоящее из:

  1. AMD Instinct MI455X GPUs
  2. 6th Gen AMD EPYC CPUs
  3. AMD Pensando AI Network Interface Cards (NICs)
  4. AMD Pensando DPU
  5. AMD Infinity Fabric
  6. AMD ROCm Software Stack

Чтобы еще больше повысить полезность своих систем Helios для AI-нагрузок, AMD заключила партнерство с Cerebras и планирует интегрировать Wafer-Scale Engine от Cerebras в свои системы Helios для молниеносного инференса.

Для тех, кто не в курсе: Wafer-Scale Engine от Cerebras размещает объем памяти и вычислительной мощности, эквивалентный целому AI-суперкомпьютеру, на одном гигантском взаимосвязанном листе кремния, где сотни тысяч вычислительных ядер и десятки гигабайт SRAM соединяются бесшовно, позволяя данным перемещаться эффективно, не сталкиваясь с внешними сетевыми узкими местами.

По сути, Wafer-Scale Engine от Cerebras может вместить целую модель среднего размера — или огромные части большой модели — в своем едином блоке SRAM. Кроме того, универсальность подхода Cerebras позволяет выполнять как обучение, так и инференс.

Согласно намеченной дорожной карте AMD, Helios будет обеспечивать высокопроизводительный масштабируемый движок пропускной способности, в то время как технология Cerebras обеспечит сверхбыструю декодировку и генерацию токенов с ультранизкой задержкой. Вместе два вычислительных движка, как ожидается, обеспечат до 5 раз больше токенов в секунду на ватт.

Это подводит нас к главной теме. Исследователь OpenAI Джеффри Ван только что щедро похвалил чипы Cerebras, которые, предположительно, используют архитектуру Wafer-Scale Engine, отметив:

«Внутренне у нас есть некоторые модели OpenAI, которые работают на чипах Cerebras. Они невероятны, потому что обеспечивают такой быстрый инференс».

Ван продолжает заявлять:

«И что это означает для меня в повседневной работе: раньше мне приходилось ждать пару минут, пока задача завершится, а теперь она завершается до того, как я успеваю переключить контекст. Это делает меня гораздо продуктивнее».

Напоминаем: AI-модели обычно переключают контекст, когда переходят от одной задачи к другой. Это может происходить в мультиагентной среде, где модель должна выполнять серию разнообразных задач, или в моделях Mixture of Experts (MoE), где различные субнейронные сети специализируются на выполнении конкретной задачи.

Тот факт, что OpenAI уже впечатлена системами Cerebras, позволяет предположить, что стоечные системы AMD Helios, интегрированные с Wafer-Scale Engine, скорее всего, будут продаваться как горячие пирожки после дебюта.

Это становится еще более важным, если учесть, что затраты на инференс сейчас являются главным фактором, определяющим прибыльность центров обработки данных.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: