OpenAI представила наиболее подробную информацию о своем новом «остром» ИИ-ускорителе Jalapeño на ежегодной конференции по разработке полупроводников Hot Chips, прошедшей во вторник в Стэнфорде.
Чипы, впервые анонсированные ранее в этом году, были разработаны в сотрудничестве с Broadcom и стали первыми в серии заказных микросхем OpenAI, спроектированных (частично) с помощью ИИ для ИИ.
По сравнению с современными графическими системами Nvidia, OpenAI утверждает, что эти компоненты обеспечат как более высокую пропускную способность, так и меньшую задержку, когда начнут поступать в конце этого года и выйдут на серийное производство в 2027 году.
Стоит уточнить: Jalapeño не заменит давних аппаратных партнеров OpenAI, которые также являются одними из ее важнейших инвесторов.
OpenAI по-прежнему нужны вычислительные мощности для обучения, а высокая программируемость GPU означает, что OpenAI, вероятно, сначала будет развертывать решения на AMD и Nvidia, а затем переходить на собственные чипы.
Также стоит отметить, что AMD MI455X и Nvidia Rubin, которые также должны выйти на серийное производство в начале 2027 года, представляют собой совершенно иные типы чипов, оптимизированные для сочетания обучения и инференса, тогда как заказное кремниевое решение OpenAI должно преуспеть только в одной задаче: инференсе.
Пропускная способность памяти — ключевой фактор
Когда речь идет об инференсе, вычислительная мощность важна, но пропускная способность памяти имеет решающее значение.
И, судя по ранним тестам, которыми OpenAI поделилась с прессой перед своей презентацией на Hot Chips во вторник, чип обещает стать настоящим монстром инференса.
Тестирование с помощью набора тестов InferenceX от SemiAnalysis — предположительно неофициального — показывает, что системы OpenAI на базе Jalapeño обеспечивают в 1,5–1,9 раза больше «работы ИИ» при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку по сравнению с конкурентами на моделях GPT-OSS-120B, DeepSeek R1 и Kimi K2.5.
Если последние две модели кажутся странным выбором для тестирования OpenAI, то дело не в том, что OpenAI планирует использовать эти чипы для запуска моделей конкурентов, — это просто модели, которые использует InferenceX. В любом случае, тест показывает, что Jalapeño не является архитектурой, заточенной под конкретные модели в ущерб программируемости… кхм, кхм, Taalas.
Между тем, для сверхнизколатентного инференса, который стал горячим новым сегментом для поставщиков ИИ-инфраструктуры, OpenAI заявляет, что ее чипы работают в 2,1–4,1 раза быстрее.
На системном уровне — и мы начинаем с этого, потому что пограничные модели, которые обучает OpenAI, редко работают на одном чипе — каждая система Jalapeño со 128 ускорителями обеспечивает 1,7 эксафлопс 4-битных вычислений, 27,5 ТБ HBM4 и почти 2 петабайта в секунду пропускной способности памяти.
Для сравнения: новейшие стоечные системы AMD и Nvidia быстрее, обеспечивая в 1,46–2 раза больше вычислительной мощности и до 12 процентов больше памяти на Helios, но лишь 85 процентов пропускной способности памяти стойки OpenAI.
На момент написания статьи OpenAI не раскрыла энергопотребление на системном уровне, но, исходя из того, что мы знаем об ускорителях, можно предположить, что каждая стойка будет потреблять от 40 до 60 процентов энергии конкурирующих GPU-систем.
Как обычно, относитесь к этим заявлениям с долей скепсиса. Конкурентные системы в данном случае — это стоечные системы Nvidia GB200 NVL72 и GB300 NVL72, выпущенные в 2024 и 2025 годах соответственно. OpenAI также исключила из сравнения спекулятивное декодирование, которое использует небольшую черновую модель для повышения производительности инференса путем прогнозирования выходных данных другой модели. Хотя можно утверждать, что это обеспечивает более чистое сравнение «яблок с яблоками», при измерении производительности инференса вы сравниваете не только оборудование, но и платформу в целом.
Присоединение к стоечной революции
Системный дизайн Jalapeño никого не удивит. Чип спроектирован вокруг стоечной архитектуры, аналогичной Nvidia NVL72 или AMD Helios.
Каждая стойка оснащена 128 ускорителями Jalapeño, каждый из которых, как нам сообщили, способен выдавать 13,4 петафлопс в формате MXFP4. Эти вычисления питаются от 216 ГБ памяти HBM4 (предположительно, шесть стеков по 12 кристаллов), обеспечивающих пропускную способность 15,4 ТБ/с.
Ожидается, что OpenAI предоставит больше информации о системе и поставках во время своей презентации на Hot Chips во вторник, но, насколько мы поняли, чип также, по-видимому, оснащен большим кэшем SRAM.
По словам Ричарда Хо, вице-президента по аппаратному обеспечению OpenAI, чип был спроектирован так, чтобы минимизировать перемещение данных и сохранять промежуточные операции, а также такие вещи, как кэши ключей и значений, отслеживающие состояние, на самом чипе.
«Мы спроектировали Jalapeño так, чтобы минимизировать перемещение данных и задержки связи. Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, может быть явно размещено и сохранено локально, в то время как система активирует правильную комбинацию вычислительных ресурсов, памяти и сети для каждой фазы инференса», — объяснила компания в блоге.
Большой кэш SRAM был бы наиболее интуитивным способом добиться этого, и именно это мы видели в разработках SambaNova, dMatrix и других компаний в их собственных ИИ-ускорителях.
Однако, в отличие от стоек Nvidia Groq LPX, Jalapeño не является «лошадкой одного трюка». Вместо этого, как нам сообщили, он оптимизирован как для вычислительно интенсивных операций prefill, где обрабатываются промпты, так и для фазы декодирования, интенсивно использующей пропускную способность памяти, где генерируются выходные токены.
«Система, которая превосходно справляется с одной фазой, может потерять это преимущество, ожидая данные или перемещая состояние модели между различными ресурсами», — объяснила компания.
Спроектирован с помощью ИИ для ИИ
Пожалуй, наименее удивительная деталь во всем этом заключается в том, что OpenAI использовала ИИ для помощи в проектировании, архитектуре и оптимизации чипа для инференса, сократив время от начала разработки до tape out (момента, когда проект полупроводника завершен и готов к отправке на фабрику для производства) до девяти месяцев.
Это включало использование своих моделей для оптимизации движков обслуживания инференса и написания пользовательских ядер по мере внедрения новых моделей.
Но, как бы впечатляюще это ни звучало, AMD и Nvidia уже некоторое время делают то же самое внутри компании. Фактически, на конференции Advancing AI в прошлом месяце «Дом Дзен» открыл свое предложение ROCm.AI для публики.
Более того, создание чипа, который может масштабироваться до сотен тысяч ускорителей, — нетривиальная задача, и AMD с Nvidia, вероятно, имеют преимущество в плане программируемости, учитывая, что GPU являются универсальными ускорителями.
В любом случае, Jalapeño не станет последним чипом, который мы увидим от OpenAI, если, конечно, пузырь не лопнет до того, как выйдет второе поколение чипов. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Tobias Mann




