Компания Nvidia пригласила около десятка журналистов в свою штаб-квартиру, чтобы подробнее рассказать о процессоре Vera CPU, а также о том, как он вписывается в более крупную стоечную конструкцию Vera Rubin NVL72, лежащую в основе новой платформы Nvidia для агентного ИИ следующего поколения. Частью этого мероприятия стало наблюдение Vera Rubin в действии — не в виде разобранного лотка на сцене или стойки с несколькими мигающими лампочками на выставке, а настоящих стоек, выполняющих реальные рабочие нагрузки в (частично) настоящем дата-центре. И нам удалось увидеть эти стойки в работе в Engineering SuperLab компании Nvidia.
Это не полноценный дата-центр, или, по крайней мере, он далёк от оптимального. Nvidia чётко дала понять, что Engineering SuperLab создан для инженеров, позволяя им быстро устанавливать и заменять стойки, чтобы видеть аппаратное обеспечение в действии. Чувствовалась некая неуверенность: если бы Nvidia строила настоящий дата-центр, он бы не выглядел так. Эта лаборатория — место работы инженеров, а если вы когда-либо бывали рядом с группой инженеров, у которых много оборудования для экспериментов, то знаете, что там не всегда так опрятно, как в настоящем дата-центре.
SuperLab, который показала нам Nvidia, — одно из четырёх непримечательных зданий рядом со штаб-квартирой Nvidia. Ранее эти локации не раскрывались. Каждое из четырёх зданий появилось за последние два года, предоставив Nvidia площадь для экспериментов по мере выхода нового оборудования.
Рассматриваемое оборудование — это стойка Vera Rubin NVL72, но мы также увидели несколько других демонстраций. В частности, Nvidia показала нам «сайдкар» (sidecar), подающий питание напряжением 800 В постоянного тока в стойку NVL72. Также Nvidia разложила некоторые детали, демонстрируя процесс сборки лотка Vera Rubin, который собирается с помощью различных фиксирующих рычагов за считанные минуты.
Это взгляд за кулисы нашего тура: как устроен Engineering SuperLab и немного «конфет» для глаз любителей дата-центров. Мы опубликовали полный разбор процессора Vera CPU и того, как он вписывается в более крупную ИИ-инфраструктуру Nvidia, с техническими деталями платформы. Здесь же мы в основном приоткрываем завесу тайны.
Vera Rubin находится в полном производстве, и мы видели короткие видео, как стойки устанавливаются в дата-центрах. Но это наш первый взгляд на стойку, выполняющую реальную рабочую нагрузку «вживую». Nvidia сообщает, что стойки здесь, по сути, выполняют некоторые рабочие нагрузки для OpenAI, и, как видно на изображении выше, некоторые лотки запускают модель GPT‑Rosalind от OpenAI.
На передней панели каждого лотка видны порты для двух сетевых контроллеров ConnectX-9, а также Bluefield-4 DPU посередине. Сзади расположен NVLink-спайн Nvidia — конструкция, напоминающая средневековое устройство с острыми штырьками, соединяющими различные лотки. В нём проложено 5000 медных кабелей общей длиной более двух миль, обеспечивающих до 3,6 ТБ/с пропускной способности на GPU и 260 ТБ/с пропускной способности масштабирования на стойку на шестом поколении NVLink.
Каждая стойка Vera Rubin NVL72 вмещает 18 вычислительных лотков и 9 лотков коммутаторов NVLink, которые управляют связью между лотками, объединяя их в одну большую унифицированную систему. Nvidia продемонстрировала нам конструкцию MGX NVL — эталонную стойку с 72 GPU Rubin и 36 CPU Vera. Конструкция MGX ETL от Nvidia заменяет NVLink-спайн на спайн Spectrum-X Ethernet или прямой чип-к-чипу для системы масштабирования с возможностью подключения до 256 GPU.
Однако основная «рабочая часть» находится сзади стоек. Хотя задняя часть свободна от кабелей благодаря NVLink-спайну, подача питания и охлаждение остаются важными факторами. Организованный хаос труб и кабелей, который вы видите на изображениях ниже, показывает, сколько усилий требуется даже для установки одной стойки, не говоря уже о десятках или сотнях в дата-центре.
Стойки Nvidia предыдущего поколения GB200 и GB300 NVL72 использовали гибридное охлаждение, но лотки Vera Rubin полностью охлаждаются жидкостью. В них нет вентиляторов, что, по словам Nvidia, со временем может привести к гораздо более тихим дата-центрам. Однако в лаборатории это было не так — здесь всё равно требовались средства защиты глаз и ушей. У меня не было под рукой измерителя децибел — представьте, если бы я постоянно носил его с собой, — но, по моим оценкам, уровень шума внутри составлял около 80–90 децибел; громче кондиционера, но тише мотоцикла. Это довольно типичный уровень шума для дата-центра.
Тем не менее, лотки Vera Rubin полностью жидкостного охлаждения с использованием процесса, называемого «сухим охлаждением». Если температура входящего теплоносителя составляет 45 градусов Цельсия или ниже, Nvidia утверждает, что способна охлаждать всю систему с помощью теплообменника. Если это так, то это позволит исключить из уравнения охлаждения затратные (с точки зрения энергии, пространства, шума, потребления воды и фактических денег) чиллеры.
Массивные трубопроводы подают теплоноситель (обычно антифриз или деионизированную воду) сверху, а выходные отверстия в нижней части стойки отводят нагретый теплоноситель. По пути расположена серия входных соединений, которые позволяют лоткам автоматически подключаться к системе охлаждения, оставляя только основные соединения в начале и конце контура. Nvidia стандартизировала всё в стойке Vera Rubin NVL72 в соответствии со стандартами Open Compute Project (OCP), вплоть до спецификаций транспортировки. Компания утверждает, что от момента подъезда грузовика до включения стойки проходит всего 47 минут.
Также Nvidia показала нам «сайдкар» на 800 В постоянного тока в действии. Если вы не в курсе, Nvidia (наряду с другими компаниями, занимающимися ИИ-инфраструктурой) продвигает новую систему подачи питания на 800 В постоянного тока для современных дата-центров, чтобы снизить потери при преобразовании AC/DC и обеспечить необходимую мощность для стоек, не доводя ток до тысяч ампер.
Одна стойка Vera Rubin NVL72 может легко потреблять более 200 кВт, что является проблемой для традиционной энергетической инфраструктуры дата-центра. В текущих стойках Grace Blackwell блоки питания преобразуют переменный ток, поступающий на объект (415В или 480В), в 48В/54В постоянного тока для распределения внутри стойки. Проблема здесь довольно прямолинейна. Если напряжение остаётся постоянным, а мощность увеличивается, то ток также должен увеличиваться. А больший ток означает более толстые шины, больше потерь при преобразовании и больше места в стойке, выделенного для подачи питания.
Опять же, решение, которое представляет собой 800 В постоянного тока, довольно прямолинейно. Если мощность увеличивается, а ток остаётся постоянным, напряжение также должно увеличиться. Идея заключается в том, чтобы преобразовать переменный ток из сети в постоянный один раз, а затем использовать серию преобразователей DC-DC внутри стойки, что обеспечивает более плотные вычисления и лучшую эффективность питания.
Решить эту проблему непросто, поскольку дата-центрам необходимо изменить то, как питание подаётся на объект, а не только то, как оно преобразуется, понижается и распределяется. Здесь Nvidia продемонстрировала сайдкар — стойку, полностью заполненную силовым оборудованием. Это «модернизация», как называет её аналитическая фирма SemiAnalysis, представляющая собой первый шаг в серии переходных фаз к 800 В постоянного тока. 415В/480В переменного тока по-прежнему распределяется по всему объекту, но поступает в этот сайдкар, а не в блоки питания внутри стойки. Сайдкар выпрямляет 415В/480В переменного тока до 800В постоянного тока и питает соседние стойки.
Всё это объяснение, чтобы показать довольно интересную энергетическую инфраструктуру, задействованную в этой лаборатории. Nvidia не первая и не единственная компания, продвигающая инфраструктуру на 800 В постоянного тока, и такие компании, как Google, Meta* и Microsoft, внесли свой вклад в открытые конструкции сайдкаров, такие как спецификация Mt. Diablo. Тем не менее, интересно увидеть один из таких сайдкаров в действии.
Если вы ещё не заглядывали за заднюю часть стойки, вы можете увидеть в галерее выше большие красные разъёмы, которые подводят питание к стойкам. Также видны массивные силовые кабели и разъёмы на задней части сайдкара на 800 В постоянного тока.
В передней части объекта Nvidia разложила все компоненты своей ИИ-инфраструктуры следующего поколения. Здесь нет ничего, чего бы мы не видели раньше, хотя обычно это прячется за выставочными стендами или демонстрируется на сцене во время ключевых докладов.
Во-первых, это сам лоток Vera Rubin NVL72, который вы видите выше рядом с лотком GB300. Оба являются дизайном DGX, то есть полностью собраны и интегрированы Nvidia, и сразу видна разительная разница в сборке. В лотке Vera Rubin NVL72 всего два кабеля, нет шлангов и вентиляторов. Сзади, где находятся две платы Super Chip, Nvidia продемонстрировала фиксирующий рычаг, который позволяет вставлять и извлекать платы за считанные секунды.
Лоток Vera Rubin намного чище, но он также эффективнее использует пространство. В нём нет вентиляторов, которые, как видно, занимают значительную часть в середине лотка в конструкции GB300. В Vera Rubin эти вентиляторы заменены толстой объединительной платой, которую вы видите выше, обеспечивающей канал связи между двумя сетевыми контроллерами ConnectX-9 и Bluefield-4 DPU на передней панели лотка.
Один из двух кабелей внутри вычислительного лотка Vera Rubin NVL72 удерживается шиной, которая отвечает за распределение питания для разных чипов внутри лотка.
Конечно, лоток Vera Rubin NVL72 — не единственное развёртывание аппаратного обеспечения Nvidia следующего поколения. Компания также показала нам лоток только с CPU с восемью чипами Vera, обеспечивающий до 256 чипов в стойке. Это даёт нам более пристальный взгляд не только на сам чип, но и на систему памяти SOCAMM2 LPDDR5X, предлагающую аналогичную плотность и модульность традиционных RDIMM при гораздо меньшем энергопотреблении.
Хотя большинство модулей не были маркированы, нам удалось сделать фотографию, которую вы видите выше, показывающую производителя модулей. Это модули SOCAMM2 объёмом 128 ГБ от Micron, работающие на частоте 6400 МТ/с, и, как видно на фото, не все слоты заняты. Это главное достижение SOCAMM2 — модульность для стандарта памяти, который в противном случае распаивается.
NVLink от Nvidia отвечает за коммуникации масштабирования (scale-up), распределённые между коммутаторами NVLink в стойке и спайном NVLink, который вы видите выше. Nvidia описывает шестое поколение NVLink как «поместить печь в автомобиль». Его цель — заставить все чипы в стойке общаться друг с другом, гарантируя, что критические операции (например, выпечка пиццы) происходят как можно ближе к месту назначения.
Связь для масштабирования (scale-out), с другой стороны, осуществляется через сетевые контроллеры ConnectX-9 в лотке и коммутаторный лоток Spectrum-X CPO (co-packaged optics). Коммутаторный лоток Spectrum-X огромен, и он хорошо иллюстрирует, сколько физического пространства выделяется для связи (по сравнению с самими вычислениями) в современном ИИ-дата-центре.
Конечно, размер коммутаторного лотка зависит от ширины инфраструктуры масштабирования. Nvidia также показала меньший лоток Spectrum-X CPO для небольших развёртываний. Это всё, что нам удалось увидеть в SuperLab дата-центра Nvidia для ИИ. Vera Rubin находится в производстве и появится во второй половине 2026 года.
Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Jake Roach




