Платформа NVIDIA Вера Рубин обеспечивает революционную пропускную способность токенов при гораздо более низкой стоимости, чем Блэквелл, демонстрируя свои возможности в области агентного ИИ.
Оптимизации программного стека NVIDIA продолжают продвигать Блэквелл, но Вера Рубин находится в совершенно другой лиге для сценариев использования агентного ИИ
Последние результаты производительности агентного ИИ на кремнии были измерены NVIDIA с использованием реальных траекторий агентного кодирования. Использовался бенчмарк SemiAnalysis AgentX, который оценивает ИИ-инфраструктуру, такую как Вера Рубин, в нагрузках инференса агентного кодирования на различных моделях, таких как Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 и DeepSeek V4 Pro.

Следующая таблица объясняет ключевые метрики AgentX:
Первыми идут результаты NVIDIA Блэквелл. Сервер GB300 NVL72 «Грейс Блэквелл» обеспечивает в 15 раз более высокую пропускную способность на МВт, чем решения H200 NVL8 «Хоппер» в DeepSeek-v4-PRO 1.6T. Решение Блэквелл поддерживает более высокую и более отзывчивую пропускную способность агентного инференса в рамках того же энергетического бюджета.

В то же время NVIDIA Блэквелл также предлагает в 10 раз более низкую стоимость (за миллион токенов) по сравнению с предшественником. Более низкая совокупная стоимость владения означает, что операторы ИИ могут поддерживать большую емкость агентов в рамках того же энергетического и инфраструктурного бюджета или обеспечивать ту же емкость с еще более низкими эксплуатационными расходами.

Еще более впечатляющим для Блэквелл является то, что он работает невероятно хорошо при масштабировании моделей. Используя Kimi K3 2.8T, решение Блэквелл обеспечило 80-кратное увеличение пропускной способности на МВт по сравнению с Хоппер и поддерживало 215 токенов в секунду на пользователя с точки зрения интерактивности, что значительно превосходит возможности решения Хоппер.

С Блэквелл покончено, теперь пришло время перейти к следующей главе агентного ИИ и инференса: Вера Рубин.

Платформа NVIDIA Вера Рубин NVL72 обеспечивает колоссальное 30-кратное увеличение пропускной способности по сравнению с Грейс Блэквелл NVL72 в DeepSeek-v4-PRO 1.6T. При интерактивности около 160 токенов в секунду на пользователя Вера Рубин просто проносится мимо Грейс Блэквелл и также достигает до ~280 TPS на пользователя, в то время как Блэквелл достигает пика ниже 180 TPS на пользователя.

Вера Рубин также предлагает значительно более низкую стоимость токенов в нагрузках агентного кодирования по сравнению с Блэквелл. 35-кратное снижение стоимости за миллион токенов показывает, что NVL72 может непрерывно запускать несколько агентов в масштабе в широком наборе нагрузок. А с такими технологиями, как NVIDIA DSX MaxLPS, которые управляют энергопотреблением на уровнях GPU, стоек и нагрузок, ИИ-фабрики могут разместить до 40% больше GPU в рамках того же мегаваттного бюджета.

Кроме того, эти бенчмарки пока не отражают производительность Vera CPU для вызова инструментов и сосредоточены только на чипах Вера Рубин, а не на полной платформе из 7 чипов «Экстремальный совместный дизайн». Поэтому по мере появления новых платформ Вера Рубин мы увидим еще более впечатляющие результаты в области ИИ-агентов и инференса. С учетом сказанного, NVIDIA уже начала производство всех своих решений на основе ИИ, включая Vera CPU, Rubin GPU, серверы Вера Рубин, чипы Groq 3 LPX и полный спектр сетевых технологий.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Hassan Mujtaba




