Если вы считали, что 72 графических процессора на стойку — это плотность, то системы следующего поколения от Nvidia и других компаний будут вмещать сотни или даже тысячи ускорителей в одну массивную систему. Но чтобы это стало возможным, потребуется много оптики и технологий, напоминающих старые телефонные коммутаторы.
Эта реальность подстегнула поток инвестиций во все: от стартапов в области фотоники до производителей оптического оборудования и волоконно-оптических кабелей. В марте Nvidia инвестировала 6 миллиардов долларов (по 2 миллиарда каждому) в Coherent, Lumentum и Marvell для развития их оптических технологий.
Часть этих инвестиций пошла на поддержку технологии оптической коммутации каналов (OCS). В среду Nvidia присоединилась к Maverick Silicon и Light Street Capital, вложив еще 125 миллионов долларов в развитие OCS-технологии второго поколения от iPronics.
Зачем коммутировать пакеты, когда можно коммутировать свет?
Оптические коммутаторы каналов являются коммутаторами лишь в буквальном смысле. В отличие от ASIC Broadcom Tomahawk или Marvell Teralynx, OCS-устройство не может коммутировать пакеты. Оптоэлектронные устройства — это современный эквивалент телефонной станции. Но вместо того, чтобы операторы вручную соединяли две телефонные линии, высокоскоростной актуатор, построенный с использованием микроскопических зеркал, пьезоэлектрических актуаторов, ЖК-дисплеев или других технологий, перестраивает сеть буквально в мгновение ока.
OCS не очень распространены в современных развертываниях GPU, но они уже довольно давно используются в AI-кластерах. В частности, Google использует OCS в своих TPU-кластерах уже много лет.
Традиционно TPU-поды Google использовали 2D и 3D тороидальные топологии, где ускорители общаются в большой сетке, а не полагаются на коммутируемые пакетные сети для их соединения. Компромисс в сетях с ячеистой топологией — это потенциально более высокая задержка между чипами и жесткость. Сами по себе они не являются самыми гибкими топологиями. Если вы хотите добавить, удалить или заменить неисправный ускоритель, кто-то или что-то должно перенастроить сеть.
В случае Google этим “что-то” является оптическая коммутация каналов. Трафик из TPU-кластеров Google передается оптически через OCS-устройства, что позволяет компании изменять размер пода по требованию или виртуально “горячим” способом заменять вышедшие из строя ускорители.
Оптическая коммутация каналов, возможно, является причиной того, что Google может эксплуатировать одни из крупнейших в отрасли вычислительных доменов. Его сетевая архитектура не ограничена радиусом действия пакетных коммутаторов.
Сглаживая более грубые края OCS
Однако существующие OCS-устройства не идеальны. Многие используют микроэлектромеханические системы (MEMS) для регулировки соединений компонентов путем перемещения микроскопических зеркал. Этот подход работает, но его нельзя назвать быстрым. Обычно указывается время переконфигурации около 100 мс.
OCS-устройства также, как правило, довольно громоздки, отчасти из-за задействованных механизмов, но также и из-за используемых разъемов.
Фотоника-стартап iPronics стремится устранить несколько из этих недостатков с помощью того, что он называет OCS “второго поколения”, который отказывается от систем на базе MEMS и ЖК-дисплеев в пользу кремниевой фотоники без движущихся частей.
Компания утверждает, что ее технология может достигать времени переконфигурации менее 1 мс, что открывает возможность изменения топологии в середине рабочей нагрузки, скрывая задержку во время вычислительных циклов.
iPronics заявляет, что ей также удается достичь более высокой плотности по сравнению с OCS-дизайнами “первого поколения”. Например, iPronics One поддерживает 32 порта на чип.
Нам сообщили, что компания работает над выводом на рынок чипов с 72 и 144 портами. Поскольку эти чипы созданы с использованием кремниевой фотоники, их можно разместить в гораздо меньших пространствах. iPronics делает ставку на то, что, используя многочиповые решения и разъемы высокой плотности, она сможет разместить до 720 пар портов в одном юните стойки.
Для сравнения, существующие OCS-коммутаторы с высоким радиусом действия, такие как 300-портовые устройства от Coherent, обычно требуют восемь или более юнитов стойки.
Место OCS в более широкой AI-сети
Даже при задержках менее миллисекунды OCS лучше всего работает в средах, где сетевые пути не меняются слишком часто.
Это сильно отличается от подхода, используемого большинством современных стоечных систем, таких как NVL72 от Nvidia или Helios от AMD, которые отдают предпочтение односкачковой связи “все со всеми” и экстремальному разнообразию путей.
Но эти два подхода не являются взаимоисключающими. iPronics пока не готова обсуждать конкретные топологии, которые используют ее клиенты. Но существует несколько потенциальных сценариев использования, включая гибридные среды, сочетающие ячеистые сети с коммутируемыми фабриками.
Как вы, возможно, помните, когда Nvidia представила свою первую платформу вычислений в масштабе стойки в 2024 году, генеральный директор Йенсен Хуанг описал 72-GPU систему как один огромный ускоритель. Это достигается за счет использования 18 сверхбыстрых чипов NVLink Switch, соединенных в сеть “все со всеми”, которая позволяет любому GPU находиться на расстоянии одного скачка от следующего.
Можно было бы подумать, что это не очень хорошо сочетается с OCS, но это может работать, используя коммутируемые фабрики по медному кабелю внутри стойки и OCS-сетку для межстоечных коммуникаций.
Однако более вероятным сценарием использования будет предотвращение выхода из-под контроля массивных кластеров LPU, которые Nvidia сейчас продает. Как мы уже обсуждали, на каждый триллион параметров Nvidia требуется восемь стоек LPX, что составляет более 2000 ускорителей.
Поскольку эти чипы в основном используют конвейерный параллелизм, данные обрабатываются по одному чипу за раз, что означает, что они уже являются хорошими кандидатами для OCS-оркестрированных ячеистых топологий и облегчат изменение размеров кластеров для различных моделей для неооблачных сервисов, таких как Nebius.
Нам потребуется более плотное подключение оптоволокна
Соединение всех этих систем потребует большого количества оптоволокна, и как раз на этой неделе другой стартап, Mixx Technologies, представил новый разъем, способный терминировать десятки тысяч волокон к одному юниту стойки.
Это достигается с помощью того, что Mixx называет своим SxC-коннектором, который включает 64 волокна, в то время как MPO обычно имеет от восьми до 24. Используя свой SxC-коннектор, компания оценивает, что сможет разместить 384 порта по 64 волокна в одном юните стойки OCP, что достаточно для 614 ТБ/с совокупной пропускной способности при скорости 400 Гбит/с SerDes. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Tobias Mann




