ASIC первого поколения Jalapeno от OpenAI разгромил конкурентов, выполняя в 1,5–1,9 раза больше работы на киловатт, чем чипы NVIDIA Blackwell, и угрожая рву CUDA

Openai Jalapeno чип Asic Hbm4 Mxfp4 wccftech.com

Узнайте, как OpenAI с помощью чипа Jalapeno бросает вызов NVIDIA. Новая архитектура с HBM4, MXFP4 и систолическим массивом обеспечивает до 1,9x больше работы на ватт при инференсе. Чип сокрушает конкурентов по производительности и задержке.

OpenAI, похоже, использовала свою текущую серию моделей, работающих на графических процессорах NVIDIA, для разработки чипа Jalapeno, а затем объединила его с собственным языком программирования ядра Gluon, тем самым осмелившись бросить вызов легендарному «рву» CUDA от NVIDIA. Как всё перевернулось!

Архитектура чипа Jalapeno от OpenAI

ASIC первого поколения Jalapeno от OpenAI разгромил конкурентов, выполняя в 1,5–1,9 раза больше работы на киловатт, чем чипы NVIDIA Blackwell, и угрожая рву CUDA
Источник: SemiAnalysis

SemiAnalysis только что предоставил подробный разбор ASIC Jalapeno от OpenAI, описав несколько новаторскую архитектуру, обеспечивающую значительную экономию масштаба.

Так, Jalapeno объединяет один вычислительный кристалл размером с ретикл, изготовленный по техпроцессу N3P TSMC, с N3E I/O чиплетом и памятью HBM4 (вероятно, от Samsung), обеспечивая 15,4 ТБ/с пропускной способности памяти на упаковку.

Ядра и память разделены на соответствующие «срезы», что даёт каждому срезу ядра локальный обзор с низкой задержкой своего назначенного среза HBM, связанного через высокоскоростную коллективную сеть.

Теперь ИИ-модели обычно не обрабатывают данные построчно. Вместо этого они обрабатывают миллиарды чисел, организованных в сетки или матрицы. Таким образом, матричный движок является «тяжеловесом», созданным исключительно для ускорения таких задач на основе сеток.

Конечно, традиционные ИИ-вычисления используют стандартные 16-битные или 8-битные числа. Однако Jalapeno использует числовые форматы MXFP. Для тех, кто не в курсе: форматы MX дополнительно сжимают данные ИИ — вплоть до 4 бит в MXFP4. Это сжатие достигается путём группировки чисел и совместного использования одного масштабного коэффициента (экспоненты), что резко сокращает объём памяти, необходимой для хранения и перемещения данных.

Матричные движки Jalapeno оснащены систолическим массивом с фиксированными весами. В стандартном CPU чип постоянно считывает данные из памяти, выполняет вычисления и записывает результат обратно в память. Это создаёт узкое место. Систолический массив, напротив, работает как человеческое сердце, перекачивающее кровь: данные поступают в сетку тесно связанных обрабатывающих ячеек, переходя от одной ячейки к другой без постоянных остановок для чтения/записи во внешнюю память.

Кроме того, ИИ-вычисления обычно включают умножение входящих данных (например, вашего запроса) на фиксированные внутренние значения (веса модели). Однако матричные движки Jalapeno являются стационарными по весам, то есть чип загружает веса модели в вычислительную сетку один раз, а затем фиксирует их на месте (стационарно).

Таким образом, замораживая тяжёлые ИИ-веса на месте (стационарные веса), плавно перекачивая данные через сетку (систолический массив) и сжимая числа (MXFP), Jalapeno устраняет узкие места перемещения данных.

Помимо матричных движков, чип Jalapeno от OpenAI также оснащён 64-битными скалярными ядрами для выполнения управляющего кода, управления памятью и координации всей операции. Эти скалярные ядра имеют внеочередные (Out-of-Order, OoO) конвейеры выполнения и оснащены кэшем L1. Это предотвращает остановку этих ядер при ожидании данных. Таким образом, внеочередные скалярные ядра работают опережая математические движки: они передают данные в специализированные аппаратные очереди, так что когда жёсткие, упорядоченные матричные и векторные ядра готовы, числа уже выстроились в очередь в ожидании их.

Наконец, чип может похвастаться векторными ядрами FP32/INT32, которые могут применять одну единственную инструкцию ко всей строке чисел одновременно, вмешиваясь в тех случаях, когда требуется высокая точность вычислений, и когда сжатие от матричных движков испортило бы результаты. Это полезно для финализации вероятностей следующего слова (слои softmax) или нормализации слоёв данных.

Конечно, OpenAI не просто строит чип Jalapeno, но и полное стоечное решение, которое состоит из:

  1. Стойка главного CPU (Katsu): Эта стойка вмещает 16 отдельных лотков главного CPU. Каждый отдельный лоток Katsu оснащён двумя процессорами AMD EPYC класса Turin, 1,5 ТБ стандартной системной памяти DRAM, локальным NVMe SSD-накопителем и сетевыми соединениями переднего плана на 400G.
  2. Стойка ускорителей ASIC (Vindaloo): Расположенная непосредственно справа от главной стойки, она содержит 16 соответствующих лотков ускорителей. Каждый лоток Vindaloo вмещает 8 ASIC Jalapeno, всего 128 чипов Jalapeno на одну стойку.
  3. Для соединения двух стоек используются 8 внешних высокоскоростных медных кабелей прямого подключения PCIe (DAC), проложенных горизонтально по передней части серверных шкафов, соединяя каждый лоток главной стойки Katsu напрямую с соответствующим лотком ASIC Vindaloo.
  4. Каждая стойка ASIC на 128 чипов обеспечивает до 1,7 экзафлопс вычислительной мощности в 4-битном формате (MXFP4) и содержит 27,5 ТБ памяти HBM4 следующего поколения на стойку, при этом каждая отдельная упаковка Jalapeno использует шесть 12-слойных стеков HBM4 для достижения поразительной пропускной способности памяти в 15,4 ТБ/с.

Чип Jalapeno от OpenAI сокрушает конкурентов

ASIC первого поколения Jalapeno от OpenAI разгромил конкурентов, выполняя в 1,5–1,9 раза больше работы на киловатт, чем чипы NVIDIA Blackwell, и угрожая рву CUDA
Источник: SemiAnalysis

Согласно результатам, опубликованным SemiAnalysis, Jalapeno является на сегодняшний день самым эффективным чипом для инференс-нагрузок. В тестовом наборе InferenceX он показал в 1,5–1,9 раза больше ИИ-работы на ватт при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку, чем лучшие результаты NVIDIA GB200/GB300, доступные на момент тестирования. Важно, что он не оптимизирован специально для одного семейства моделей и, по-видимому, с лёгкостью запускает любые модели.

По данным SemiAnalysis, Jalapeno «обеспечивает 13,4 Пфлопс MXFP4 на одном вычислительном кристалле размером с ретикл, изготовленном по техпроцессу N3P TSMC. Для сравнения, один вычислительный кристалл Rubin аналогичного размера и на том же техпроцессе выдаёт 17,5 Пфлопс плотного Rubin NVFP4».

Более того, хотя OpenAI оценила TDP Jalapeno в 700 Вт, его устойчивое энергопотребление обычно остаётся на уровне или ниже 550 Вт во время активных ИИ-нагрузок.

Критически важно, что Jalapeno достигает этого результата, используя архитектуру с предсказанием одного токена (Single-Token Prediction, STP), где модель принимает запрос, обрабатывает его и предсказывает ровно один токен (слово или часть слова) за раз. Это означает, что ASIC не полагалась на архитектурные уловки, такие как предсказание нескольких токенов (MTP) или спекулятивное декодирование, чтобы завысить свои показатели производительности. Стоит отметить, что спекулятивное декодирование даёт примерно трёхкратное улучшение стоимости токена.

В качестве последнего замечания: обратите внимание, что Jalapeno оснащён памятью HBM4, в то время как системы GB200 и GB300 — HBM3E. Это немного играет на руку ASIC от OpenAI.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: