Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Nvidia Rubin Gpu архитектура Hbm4 ии wccftech.com

NVIDIA раскрыла архитектуру GPU Rubin: 336 млрд транзисторов, HBM4 на 22 ТБ/с и 10-кратный прирост агентной производительности. Узнайте, как чип на 3 нм переопределяет стандарты для дата-центров и агентного ИИ.

NVIDIA полностью раскрыла архитектуру Rubin AI GPU, которая представляет собой колоссальный скачок по сравнению с Blackwell для эпохи агентного ИИ.

NVIDIA переосмысливает дата-центры с GPU Rubin, обеспечивая самую высокую производительность ИИ в мире

GPU Rubin лежит в основе платформ NVIDIA нового поколения для дата-центров; это чип, на создание которого ушли годы, и теперь он наконец выходит в широкий доступ. С учетом того, что первые платформы на Rubin уже поступают к крупнейшим технологическим компаниям по всему миру, NVIDIA настало время раскрыть все детали архитектуры, которая легла в основу этого сверхмощного ИИ-чипа, которому суждено сформировать ландшафт агентного ИИ.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

По данным NVIDIA, чип Rubin обеспечивает в 10 раз более высокую агентную пропускную способность на единицу энергии по сравнению с Blackwell, и достигает этого с помощью трех основных архитектурных изменений:

  • Улучшенные тензорные ядра с расширенными возможностями точности
  • Новая подсистема памяти HBM4
  • Трансформерный движок третьего поколения

Но для начала давайте разберем архитектуру, заглянув внутрь чипа.

Архитектура Rubin под микроскопом: монстр с миллиардами транзисторов

Чип Rubin от NVIDIA изготовлен по техпроцессу TSMC 3nm (N3P) и содержит два кристалла, ограниченных размером ретикла, для достижения высокой плотности и эффективности, определяющих этот чип. Эти два кристалла соединены в едином корпусе через высокоскоростной интерфейс NVIDIA (NV-HBI). Чип содержит в общей сложности 336 миллиардов транзисторов, что на 62% больше, чем у чипа Blackwell GB300.

Под капотом каждого GPU Rubin находятся 8 GPC (кластеров обработки графики) с общим количеством 224 SM (потоковых мультипроцессоров) и 896 тензорных ядер. Это должно составлять 28 SM и 112 тензорных ядер на GPC, но, судя по блок-схеме, существует два типа GPC: один с 30 SM, а другой с 26 SM.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

На каждом кристалле расположены четыре GPC, которые соединены с двумя блоками большого децентрализованного кэша L2, движком Gigathread Engine, четырьмя каналами HBM (4096 бит на кристалл) и интерфейсом NVLink. Чип также содержит контроллер PCIe Gen6 для взаимодействия с хост-процессором, а ввод-вывод NVLink v6 обеспечивает 3600 ГБ/с при соединении с коммутатором NVLink. Контроллер MIG разделяет GPU для нескольких рабочих нагрузок, а также присутствует NV-DEC для ускоренного декодирования.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Чип также поддерживает конфиденциальные вычисления через TEE-I/O, что обеспечивает безопасность данных в состоянии покоя, при передаче и во время использования в рамках ИИ-рабочих процессов.

Самая быстрая HBM4 на рынке для ускорения передачи данных

В части памяти NVIDIA Rubin использует HBM4 — новейший стандарт HBM. Потребность в более быстрой передаче данных стала критической в современном ИИ-ландшафте, и Rubin идет ва-банк, предлагая 288 ГБ емкости в восьми стеках 12-Hi (это 36 ГБ на стек и 3 ГБ на DRAM). Эти стеки обеспечивают пиковую пропускную способность 22 ТБ/с, что делает их самым быстрым решением HBM4 на рынке.

NVIDIA также использует свой новый и улучшенный тензорный ускоритель памяти (TMA) для эффективного перемещения высокосложных данных внутри чипа, в то время как NVLink 6 обеспечивает 3600 ГБ/с для масштабирования связи GPU-GPU по принципу «каждый с каждым». Интерфейс NVLink-C2C обеспечивает 1800 ГБ/с для связи CPU-GPU, а линии PCIe Gen6 x16 предоставляют 256 ГБ/с пропускной способности для подключения хост-процессора.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

HBM4 ускоряет генерацию токенов

Память HBM4 для Rubin разработана для максимальной энергоэффективности и вычислительной эффективности, что приводит к более быстрому декодированию и генерации токенов. Большинство современных рабочих нагрузок тратят время на обработку длинных контекстов, больших KV-кэшей и интерактивную генерацию токенов, что делает пропускную способность еще более критичной. Благодаря 2,8-кратному увеличению по сравнению с решением памяти Blackwell (22 ТБ/с против 8 ТБ/с), решение HBM4 обеспечивает:

  • Емкость: поддерживает размещение моделей, более широкие контекстные окна, большие KV-кэши и более высокий уровень параллелизма без необходимости выгрузки KV-кэша.
  • Пропускная способность: поддерживает фазу покадровой генерации токенов, во время которой веса модели и состояние KV должны перемещаться достаточно быстро, чтобы вычислительные движки оставались продуктивными.
  • Подсистема памяти: TMA и стратегии локальности памяти помогают программному обеспечению эффективно использовать подсистему памяти, обеспечивая высокую достижимую пропускную способность для сложных структур данных.

HBM4 усиливает Rubin, что необходимо для поддержки моделей с триллионами параметров, расширения длины контекста без проблем с выгрузкой KV-кэша, а также для поддержки гораздо более высоких показателей параллелизма и рабочих нагрузок долгосрочного вывода.

Ускорение MoE и токенов с помощью улучшенного тензорного ускорителя памяти

Rubin также оснащен улучшенным тензорным ускорителем памяти (TMA), который эффективно находит и перемещает веса экспертов по мере роста числа экспертов в моделях MoE. TMA снижает накладные расходы на перемещение данных благодаря улучшенной обработке дескрипторов, что позволяет программному обеспечению работать более эффективно. Встроенный дескриптор также получил обновленную поддержку TMA и позволяет ядру хранить единый унифицированный дескриптор для тензоров с одинаковой компоновкой и переопределять такие поля, как указатель памяти и шаг, непосредственно в инструкции TMA во время выполнения.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Результатом является более эффективное масштабирование моделей MoE даже при увеличении количества экспертов. Это позволяет чипу выделять больше времени на вычислительные операции вывода для достижения более высокой пропускной способности.

Более быстрые тензорные ядра для более высокой пропускной способности

Улучшенные тензорные ядра были модернизированы, чтобы обеспечить удвоение пропускной способности за такт. Это достигается за счет удвоения объема данных, которые тензорное ядро может обрабатывать по измерению K. Это помогает ядрам, ограниченным пропускной способностью, и ядрам, ограниченным памятью/задержками.

NVIDIA объясняет, что преимущество большего измерения K заключается в меньшем количестве итераций цикла по K. Например, GEMM, для которого на Blackwell требовалось четыре итерации K, на чипах Rubin может быть выполнена всего за две итерации.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Также были улучшены механизмы внимания за счет объединения разреженности активаций с адаптивным сжатием и повышения пропускной способности softmax. Конвейер внимания начинается с плотного вычисления QK^T для генерации промежуточных оценок внимания.

Затем Rubin может загрузить эти промежуточные данные из тензорной памяти в структурированную разреженную форму 2:4, генерируя как ненулевые значения, так и метаданные, необходимые для их эффективного использования, одновременно снижая затраты на запись оценок и требования к их хранению. Это позволяет последующим этапам внимания работать с меньшим объемом данных, сохраняя при этом плотный формат вывода, ожидаемый остальной частью модели.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Также наблюдается увеличение экспоненциальной пропускной способности Rubin по сравнению с базовым Blackwell. Rubin обеспечивает вдвое большую пропускную способность FP32 (за такт на SM) по сравнению с GB200 и такую же, как GB300, в то время как пропускная способность BF16/FP16 увеличена в четыре раза по сравнению с базовым Blackwell (GB200) и вдвое по сравнению с Blackwell Ultra (GB300).

Rubin также обеспечивает более тонкую координацию между зависимыми ядрами. Это позволяет потребительской работе начинаться раньше, как только становятся доступны необходимые входные данные, вместо ожидания завершения более крупного набора производящей работы.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Результатом является более плотная временная шкала GPU, сокращение простоев и улучшение перекрытия между зависимыми ядрами. Это особенно ценно для агентного вывода, где активации последовательно проходят через модель, а задержка между ядрами напрямую влияет на количество токенов в секунду на пользователя.

Дополнительные улучшения энергоэффективности с DSX MaxLPS

Еще одним фактором, критически важным для современных ИИ-дата-центров, является энергоэффективность. Системы Vera Rubin NVL72 являются передовыми и включают некоторые новые функции для ее повышения, такие как управление питанием и интеллектуальное сглаживание мощности с накоплением энергии в едином домене выполнения, предназначенном для максимизации полезного вывода токенов в рамках фиксированного энергопотребления.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Кратковременные пики могут снижать общую пропускную способность, «замораживая» доступную мощность на ИИ-фабрике. Чтобы решить эту проблему, системы Vera Rubin оснащены интеллектуальными блоками питания со сглаживанием мощности на основе состояния заряда (SoC), которые поглощают эти кратковременные колебания, снижая среднее энергопотребление примерно на 10% по сравнению с предыдущим поколением. Они также снижают пиковую мощность на 50 мс на 20%, обеспечивая оптимизированный профиль мощности, способный выдерживать максимальные требования.

Для ИИ-фабрик ОС NVIDIA DSX, включающая DSX MaxLPS, работает на уровне GPU, стоек, жидкостного охлаждения и рабочих нагрузок, предоставляя операционный уровень для планирования, управления жизненным циклом и автоматизации работоспособности, что позволяет разместить на 40% больше GPU в рамках того же энергопотребления, увеличивая пропускную способность каждого развертывания.

Графические процессоры NVIDIA Рубин демонстрируют 10-кратный прирост производительности агентного ИИ по сравнению с Блэквелл, а их архитектура полностью раскрыта и насчитывает 336 миллиардов транзисторов.

Все это в совокупности делает Rubin передовым чипом для ИИ-дата-центров, который откроет новую главу в развитии возможностей ИИ, распространяясь на агентные ИИ-рабочие процессы и на то, что будет после них.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: