Hot Chips 2026: Nvidia разбирает 88-ядерный процессор Вера

Nvidia Vera Hot Chips 2026 пространственная многопоточность Lpddr5x агентный ии цпу tomshardware.com

Узнайте о преимуществах пространственной многопоточности и энергоэффективной памяти LPDDR5X в процессоре Nvidia Vera для агентных ЦОД. Оцените рост производительности на 22–24% в компиляции и браузерных сценариях по сравнению с AMD EPYC. Погрузитесь в детали архитектуры Olympus и сравнения с Venice и Diamond Rapids.

Эта премиум-статья Tom’s Hardware доступна для чтения бесплатно при наличии учётной записи Tom’s Hardware; оплата не требуется. Мы предоставляем бесплатный доступ с 23 по 26 августа, чтобы вы могли прочитать все наши репортажи с Hot Chips. За последние несколько месяцев Nvidia сделала ряд ключевых раскрытий о своём процессоре Vera следующего поколения для агентных ЦОД, которые продолжились на Hot Chips 2026. Хотя мы уже многое узнали о Vera, о том, как он сравнивается с процессорами AMD Venice следующего поколения и о внутреннем устройстве ядра Olympus, на Hot Chips Nvidia привела больше подробностей о пространственной многопоточности, подсистеме памяти и типах рабочих нагрузок, на которые она ориентирует Vera.
Напомним: Vera — это первый процессор с собственным ядром Nvidia, пришедший на смену Grace, который использовал стандартную конструкцию Arm. Он поставляется в виде единственного SKU с 88 ядрами и имеет ключевые конструктивные отличия от конкурентов Nvidia на архитектуре x86, наиболее заметные из которых — реализация многопоточности, которую Nvidia называет пространственной многопоточностью, подсистема памяти LPDDR5X и монолитный кристалл вместо использования вычислительных чиплетов.
Nvidia заявляет, что разработала Vera специально для агентных рабочих нагрузок ИИ — категории, которая всё ещё определяется с точки зрения бенчмаркинга производительности. Многие задачи, интенсивно использующие процессор, служат прокси для агентных нагрузок (например, компиляция кода), хотя измерение производительности в рамках полной агентной цепочки сложно и неоднозначно. Сама Nvidia в своих слайдах (см. в конце статьи) называет агентный ИИ «самой сложной вычислительной нагрузкой в истории».
Nvidia привела пример безголового браузера, чтобы продемонстрировать преимущества Vera, используя оптимизированный код для имитации того, как агент использует браузер. По сравнению с 96-ядерным EPYC 9655P, Nvidia утверждает, что Vera работает на 24% быстрее при масштабировании экземпляров браузера.
Этот слайд хорошо демонстрирует сложность измерения традиционных нагрузок и переноса этой производительности на агентные рабочие процессы. Агенты часто загружают веб-сайты для получения информации, но есть несколько уровней, на которых агенты могут сократить объём работы по сравнению с людьми; в данном случае агенты могут выполнять рабочий процесс просмотра в 4,5 раза быстрее, исключив такие вещи, как рендеринг GUI, шрифты, декодирование мультимедиа и многое другое.
Ещё одним ориентиром для производительности агентов является компиляция кода, поскольку агенты ищут программное обеспечение для компиляции в системе. Возможно, это самый прямой бенчмарк производительности агентного ИИ при текущих рабочих процессах. Однако, как уже упоминалось, агентные цепочки длинны, сложны и включают несколько различных нагрузок.
Вновь сравнивая с 96-ядерным EPYC 9655P, Nvidia утверждает, что Vera компилирует ядро Linux на 22% быстрее при родной компиляции для AArch64 и на 14% быстрее при кросс-компиляции для x86.
Nvidia вновь подчеркнула важность больших ядер внутри Vera, включая большой BPU, нейронный предсказатель переходов и декодирование 10 команд за такт. Ранее Nvidia раскрыла архитектуру ядра Olympus, о которой можно прочитать в нашем глубоком разборе Vera. В целом, однако, это широкое ядро, оптимизированное для высокой однопоточной пропускной способности.
Одной из наиболее интересных конструктивных особенностей Vera является пространственная многопоточность, которую Nvidia подробнее описала в ходе Hot Chips 2026. Если кратко, Nvidia разделяет ресурсы ядра между двумя конвейерами, хотя данные и кэш могут перемещаться между потоками по мере необходимости. Чтобы продемонстрировать преимущество, Nvidia поделилась результатами SPEC CPU 2017 intrate, которые вы можете увидеть ниже.
Это показывает эффект «шумного соседа». Nvidia измерила однопоточную производительность, а затем измерила ту же нагрузку при активном другом потоке. Данные Nvidia показывают, что Vera меньше подвержена влиянию соседнего потока, тогда как «традиционный процессор» демонстрирует большее замедление. Однако Nvidia не уточнила, с каким именно процессором она сравнивает Vera.
Слайд Nvidia хорошо иллюстрирует это, но всё же стоит отметить отличие от традиционного SMT. При традиционном SMT ресурсы распределяются между потоками по времени, что приводит к разрывам между BP и декодированием, как показано на слайде. При пространственной многопоточности в Vera потоки всё ещё борются за ресурсы внутри ядра. Однако пространственная многопоточность позволяет Nvidia детерминированно обрабатывать запросы соседних потоков, что приводит к более равномерному снижению производительности на ядро при работе второго потока.
Второе поколение масштабируемой когерентной фабрики (SCF) Nvidia перемещает данные по кристаллу. Nvidia не предоставила новых раскрытий о SCF на Hot Chips, но вы можете увидеть, как фабрика размещена, на слайде ниже. Централизованные узлы когерентности (CSN) соединяют ядра с пулами кэша L3 общим объёмом 164 МБ и более широкой подсистемой памяти.
На системном уровне одним из наиболее интересных решений Nvidia стало использование LPDDR5X вместо традиционных RDIMM — выбор, который она смогла сделать только благодаря обслуживаемой конструкции SOCAMM2. Nvidia включает восемь слотов SOCAMM2 на процессор Vera на плате, обеспечивая до 1,5 ТБ ёмкости с пропускной способностью 1,2 ТБ/с.
LPDDR5X может обеспечить более высокие скорости передачи данных, чем DDR5 RDIMM, по крайней мере по сравнению с одноранговыми DIMM. Однако, похоже, движущей силой выбора LPDDR5X была не производительность, а энергопотребление. Одним из столпов Vera, согласно презентации Nvidia на Hot Chips, было создание процессора для ЦОД с ограниченным энергопотреблением. Micron заявляет, что её LPDDR5X потребляет примерно треть энергии по сравнению с традиционным RDIMM.
Nvidia продемонстрировала это немного иначе, используя пропускную способность на ватт в качестве точки сравнения между системой LPDDR5X в Vera и традиционными RDIMM. Эта иллюстрация выполняет свою задачу, хотя может быть несколько вводящей в заблуждение, измеряя энергопотребление относительно пиковой пропускной способности.
Nvidia сообщает нам, что полностью загруженная система памяти с Vera потребляет от 30 до 40 Вт при ёмкости 1,5 ТБ и частоте 9600 МТ/с. Энергопотребление RDIMM сильно варьируется в зависимости от ёмкости, каналов и скорости передачи, хотя в зависимости от конфигурации оно может легко превышать 100 Вт.
Хотя Nvidia развернула Grace в ЦОД — в объёме «сотен тысяч» автономных серверов, по-видимому, — Vera представляет собой первую крупную попытку Nvidia захватить долю рынка на расширяющемся рынке агентных процессоров. Он очень целенаправлен, о чём свидетельствует тот факт, что Nvidia поставляет только один SKU с 88 ядрами, и он уже используется в крупномасштабных развёртываниях: Nvidia вчера объявила о развёртывании Vera в SpaceXAI.
Nvidia ранее показывала слайд выше, который снова продемонстрировала на Hot Chips 2026. Он нормализует производительность на ядро в SPEC CPU 2026 относительно AMD EPYC 9755. Различия в ядрах объясняют большой разброс чисел; на самом деле Vera опередил по общему показателю на 3%. Тем не менее, это слайд, который Nvidia использует для продвижения Vera, утверждая, что он обеспечивает значительное улучшение в наиболее релевантных для агентного ИИ нагрузках.
Однако самым грозным противником для Vera является не Turin. Это Venice, который AMD запустила в июне, и Diamond Rapids, который Intel подробно представила сразу после того, как Nvidia покинула сцену. У Vera уже есть много интересных тем для обсуждения, но будет интересно понаблюдать, как Nvidia будет масштабировать (или не будет) свой бизнес процессоров для ЦОД в ближайшие несколько поколений. Возможно, мы увидим, что компания удвоит ставку на эти агентные рабочие процессы, или, возможно, пойдёт на уступки и сегментирование продуктов, чтобы привлечь гиперскейлеров. Время покажет.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: