AMD приближается к своей цели — сделать так, чтобы ИИ жрал меньше… энергии

Amd ии эффективность стойки Gpu Helios theregister.com

AMD заявляет о четырехкратном росте энергоэффективности ИИ-систем с 2024 года. Узнайте, как Helios с 72 GPU приближает цель 20-кратного повышения эффективности стоек к 2030 году и обходит ли компания Nvidia в гонке за FLOPS на ватт.

Неутолимая жажда энергии со стороны ИИ продолжает вызывать беспокойство, но не стоит паниковать: AMD заявляет, что неуклонно продвигается к своей цели — повысить эффективность стоек в 20 раз к концу десятилетия.

В блог-посте, опубликованном на этой неделе, «Дом Дзен» оценивает, что уже к 2026 году их системы станут в 4 раза эффективнее, чем в 2024-м.

Безусловно, с тех пор многое изменилось. Как вы, возможно, помните, именно в том году AMD начала серийное производство MI300X — своего первого настоящего датацентричного GPU, предназначенного для ИИ.

Компонент мощностью 750 Вт обеспечивал до 2,6 петафлопс производительности FP8, что на тот момент делало его конкурентоспособным на бумаге с ускорителями ИИ поколения Hopper от Nvidia.

С тех пор AMD задействовала все рычаги и нажала все кнопки, чтобы выжать больше FLOPS на ватт из своих GPU-систем, сильнее нагружать память и масштабируемые шины, а также оптимизировать программный стек, чтобы догнать более крупного и успешного конкурента. Это включало добавление поддержки 4-битных типов данных с плавающей запятой, новых технологий памяти, увеличение скорости межсоединений и переход от традиционных GPU-серверов к полностью интегрированным стоечным системам.

«Парадоксально, но… чем больше устройство, тем оно эффективнее», — заявил El Reg в прошлом году Сэм Нафцигер, старший вице-президент и феллоу AMD, когда производитель чипов объявил об инициативе. 

В прошлом месяце AMD представила плоды своих трудов, запустив упомянутую стоечную вычислительную платформу под кодовым названием Helios, которая вмещает 72 GPU MI455X в одну массивную систему.

По сравнению с MI300X, каждый MI455X обеспечивает от 7,7 до 15,4 раза более высокую производительность операций с плавающей запятой, в 2,25 раза больше памяти HBM, в 4,4 раза более быструю память и в 4 раза большую пропускную способность межсоединений между чипами. 

Без сомнения, чип быстрее, но он также потребляет более чем в 3 раза больше энергии. Вместо этого наибольший прирост производительности достигается за счет того, насколько эффективно AMD может масштабировать рабочие нагрузки ИИ на шести десятках ускорителей системы.

Как обычно, AMD здесь не является пионером. Nvidia совершила переход на стоечный масштаб в конце 2024 года с запуском своих систем Grace Blackwell NVL72, которые также объединяют 72 GPU в одну систему размером со стойку.

Тогда генеральный директор Nvidia Дженсен Хуанг похвастался, что по сравнению с эквивалентным количеством GPU Hopper стойки GB200 NVL72 обеспечивают четырехкратное ускорение обучения и 30-кратное улучшение производительности инференса. 

Хотя преимущества стоечных архитектур очевидны, стоит подчеркнуть, что AMD использует совершенно другую методологию расчета эффективности, взвешивая максимально достигнутые FLOPS, память и пропускную способность межсоединений по-разному для обучения и инференса, а не основывая свое сравнение на производительности в реальных приложениях.

Также стоит отметить, что заявление AMD о четырехкратном увеличении является оценкой.

Первые устройства Helios должны быть отгружены клиентам в текущем календарном квартале. Мы ожидаем, что первые тесты MLPerf и InferenceX последуют вскоре после этого.

Однако, если предположить, что AMD сможет выполнить свои цели, то две стойки Helios смогут выполнить ту же работу, для которой в 2024 году требовалось 570 стоек оборудования.

Если говорить более реалистично, при той же потребляемой мощности клиенты смогут развернуть в 20 раз больше вычислительных мощностей, при условии, что к тому времени пузырь еще не лопнет и не унесет с собой спрос. ®

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: