Nvidia и Cerebras продают производительность, которую их клиенты (вероятно) никогда не увидят

Nvidia Groq-3 Cerebras инференс бенчмарки парето theregister.com

Хвастаться генерацией одного токена — все равно что хвастаться максимальной скоростью автомобиля. Узнайте, почему пиковые показатели Nvidia Groq-3 и Cerebras CS-4 в 3400 ток/с — это маркетинг, а не реальная производительность, и какой бенчмарк действительно важен для премиального инференса.

На конференции Hot Chips в Калифорнии на этой неделе прозвучали выстрелы: Nvidia объявила о начале производства новых стоек LPX на базе Groq-3, и ранние тесты показали, что системы выдают ошеломляющие 3 400 токенов в секунду в Gemma 4 31B. Это в четыре раза быстрее, чем у конкурента Cerebras.

Днем позже Cerebras ответила, заявив о почти эквивалентной производительности своих ускорителей CS-4 следующего поколения, представленных на прошлой неделе.

Эти пиковые показатели производительности делают инференс мгновенным по сравнению с чат-ботами, к которым мы привыкли за последние четыре года. Но по сути, две компании спорят о цифрах, которые их клиенты, вероятно, никогда не увидят в реальной эксплуатации.

Чтобы было ясно, никто не лжет. Если вы захотите воспроизвести эти результаты, вы, безусловно, сможете — команда Artificial Analysis, ответственная за оба набора бенчмарков, знает свое дело — но, помимо маркетингового трюка, ни один оператор модели inference-as-a-service в здравом уме не будет запускать ни одну из этих систем таким образом. Только если вы каким-то образом не выяснили, как получать прибыль, обслуживая по одному запросу за раз.

В реальности эти цифры больше похожи на максимальную скорость гоночного автомобиля. Это отлично подходит для маркетинга, но вы, вероятно, не ездите так быстро на регулярной основе, а если бы и ездили, то не уехали бы далеко, прежде чем бак опустеет.

Это не те цифры, которые имеют значение

Неудивительно, что экономика «премиального» или «ультра-низколатентного» инференса немного сложнее, но в конечном итоге сводится к тому, насколько эффективно вы можете масштабировать эту производительность на крайнем правом конце границы Парето.

Мы уже показывали график ниже. Он отображает характеристики производительности различных конфигураций Nvidia B300 на фронте Парето. Как видите, графические процессоры отлично подходят для приложений с высокой пропускной способностью и низкой интерактивностью, но быстро исчерпывают свои возможности по мере роста скорости генерации на одного пользователя. Такие чипы, как Nvidia Groq-3 LPU или ускорители Cerebras размером с обеденную тарелку, обеспечивают огромную пропускную способность благодаря своей архитектуре с большим объемом SRAM, поэтому они могут расширять и сдвигать кривую Парето вправо.

К сожалению, то же самое, что делает их такими быстрыми, также ограничивает их способность масштабировать эту производительность для большого числа пользователей. Чтобы понять почему, нам нужно пройтись по небольшой математике.

Мы остановимся на Gemma 4 31B, отчасти потому, что у нас есть примерные цифры как для Nvidia, так и для Cerebras, но также и потому, что это небольшая модель и, следовательно, представляет собой наилучший сценарий.

Каждый ускоритель Groq-3 оснащен 500 МБ встроенной памяти. Nvidia достигла 3 400 ток/с на пользователя при работе с 8-битной точностью. Таким образом, для запуска модели с 31 миллиардом параметров нам нужно около 31 ГБ памяти или около 64 LPU. Но это только для хранения весов модели.

Поскольку система работает автономно, мы также должны учитывать кэши KV, создаваемые на этапе prefill, на котором обрабатывается промпт. Согласно KV-калькулятору LMcache, при 8-битной точности входная последовательность из 100 000 токенов «съест» еще 8 ГБ памяти, и это на одну последовательность. Таким образом, на каждые дополнительные 100 000 токенов на входе требуется еще 16 LPU памяти.

По нашим оценкам, это означает, что максимум, что может выдержать одна стойка LPX с ее 256 LPU до исчерпания памяти, — это размер пакета (batch size) 12 при длине входного сигнала в 100 000 токенов каждый.

Цифры для Cerebras CS4 выглядят немного иначе, но вывод в значительной степени не меняется. Каждая стойка CS4 содержит три массивных ускорителя WSE-3T с 44 ГБ SRAM каждый, что в сумме дает 132 ГБ емкости. Это оставляет системе немного больше запаса, но мы все равно смотрим на максимальный размер пакета 12.

Чтобы было ясно, это не вычислительное ограничение. У систем просто недостаточно памяти для поддержки больших пакетов без добавления дополнительных стоек или сокращения размера промпта.

Конечно, мы немного упрощаем. Мы предполагаем пакетный инференс с фиксированными входными последовательностями, а не одновременных пользователей, обращающихся к системам асинхронно, каждый раз с разными входными и выходными последовательностями. Для чат-бота, особенно с ограниченным контекстным окном — представьте краткосрочную память модели — одна стойка CS4 или LPX теоретически может обслуживать гораздо больше пользователей, чем 12, указанные здесь.

Поднимая кривую

Даже если обе системы могут достичь 3 400 ток/с, лучшей платформой будет та, которая обеспечит лучшее масштабирование при более низкой стоимости и энергопотреблении.

Показатели бенчмарков, разрекламированные Nvidia и Cerebras на этой неделе, на самом деле измеряют максимальную скорость, на которой системы могут работать, а не скорость, с которой клиенты будут их фактически запускать.

Фактически, клиенты, вероятно, не будут запускать эти системы самостоятельно. Эти архитектуры с большим объемом SRAM работают намного лучше в качестве ускорителей декодирования, и именно поэтому Nvidia потратила 20 миллиардов долларов на лицензирование технологии Groq и переманивание ее инженерной команды. Это также причина, по которой Cerebras недавно объединилась с AWS и AMD.

Мы уже обсуждали такие гетерогенные вычислительные архитектуры в прошлом, но в двух словах они включают графические процессоры или другие вычислительно-тяжелые XPU, такие как чипы Amazon Trainium, в сочетании с чем-то вроде LPU от Groq, ускорителями на уровне пластин от Cerebras или компонентами серии SN от SambaNova.

Такая комбинация в значительной степени устраняет или, по крайней мере, минимизирует накладные расходы на кэш KV и вычисления, которые делали масштабирование чипов Cerebras и Groq таким сложным. В качестве ускорителей декодирования им действительно нужно только хранить веса модели, так как почти все остальное может прекрасно работать на GPU.

Опять же, пиковая производительность ИИ создает отличные заголовки, но крайняя правая часть Парето — это редко то место, где вы захотите оказаться. Как это обычно бывает с кривыми Парето, оптимальная точка обычно проявляется в виде заметного «горба» или «колена», стремящегося к верхнему правому углу графика. Здесь вы будете обменивать некоторую интерактивность на одного пользователя на лучшую конкурентность, пропускную способность и экономику.

Объединение GPU с ускорителями Cerebras или Groq — это то, на что Nvidia, AMD и AWS рассчитывают, чтобы сделать «премиальный инференс» экономически эффективным.

Для этого есть лучший бенчмарк

Мы еще не видели бенчмарков, сочетающих чипы Cerebras или Groq с соответствующими платформами GPU и XPU от Nvidia, AMD или AWS, но именно эти метрики будут иметь реальное значение.

InferenceX от SemiAnalysis предлагает лучшее представление о том, поможет ли вообще добавление стойки CS4 или LPX, поскольку мы можем видеть, как каждая система работает по всему спектру Парето, от высокообъемных низкоинтерактивных «пакетных» токенов слева до ультра-низколатентных, но также и менее объемных токенов справа.

Фактически, в то время как Nvidia и Cerebras выбрали более простую тестовую методологию Artificial Analysis, OpenAI фактически выбрала InferenceX, чтобы показать, как ее новые «острые» ускорители Jalapeño работают в режимах пакетного и премиального инференса.

Так почему же Nvidia и Cerebras не сделали того же? Если нам нужно угадать, то потому, что их стойки LPX и CS4 по-прежнему лучше всего подходят для низколатентного инференса и не будут выглядеть так впечатляюще на левой и средней частях кривой Парето.

Мы полностью ожидаем, что обе компании поделятся результатами InferenceX для своих комбинированных систем GPU и LPX/CS4, когда они будут готовы, но ни один маркетолог еще не получал бонус за то, что сделал свой продукт хуже, чем он есть на самом деле, так что нам просто придется подождать.

В любом случае, в следующий раз, когда вы увидите, как кто-то хвастается каким-то невероятно быстрым ускорителем инференса, стоит спросить, откуда на кривой Парето взялось это число. ®

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: