Новые NPU Ascend от Huawei — лучшая ставка Китая для локальных вычислений

Huawei ии Ascend ускорители китай Nvidia theregister.com

Huawei Ascend 960DT: новый ИИ-ускоритель для Китая. Опережает Nvidia, обещает удвоенную производительность и память. Узнайте о масштабировании и будущих поколениях.

На своей ежегодной конференции Connect компания Huawei представила новое поколение ИИ-ускорителей, которые обещают производительность, значительно превосходящую все, что Nvidia может предложить на данный момент на китайском рынке. Это может стать благом для китайских разработчиков, привыкших приобретать менее мощное оборудование у излюбленного поставщика ИИ-решений.

Если этого недостаточно, то чип под кодовым названием Ascend 960DT (где DT, по-видимому, означает decode/training) будет выпущен на три квартала раньше запланированного срока, в первом квартале 2027 года.

Обладая до 288 ГБ памяти, предположительно собственной разработки Huawei HiZQ, являющейся отечественной альтернативой высокопроизводительной памяти (HBM), используемой остальным миром, и до четырех петафлопс производительности FP4 (половина этого значения при FP8), ускоритель предлагает вдвое большую производительность и объем памяти по сравнению с моделями 950-й серии компании, выпущенными ранее в этом году.

По сравнению с американскими GPU, 960DT предлагает сопоставимую с семейством чипов Nvidia B300, выпущенным в прошлом году, память и пропускную способность, но лишь около половины производительности FP8 и треть производительности FP4.

Хотя это и большой шаг вперед для китайского разработчика чипов, ему еще предстоит пройти долгий путь, чтобы догнать Nvidia Rubin и недавно выпущенный AMD MI455X, которые обещают значительно более высокую вычислительную мощность и пропускную способность. Rubin может похвастаться производительностью FP4 от 35 до 50 петафлопс, 288 ГБ памяти HBM4 и пропускной способностью 22 ТБ/с, что ставит его в совершенно другую лигу.

Тем не менее, ни один из этих чипов не доступен для продажи в Китае, так что у китайских разработчиков моделей нет лучших вариантов. Лучший GPU, который Nvidia может продать в Китае, предлагает почти идентичную производительность в операциях с плавающей запятой, вдвое больший объем памяти, удвоенную пропускную способность памяти и поддержку гораздо более крупных масштабируемых доменов.

Масштабирование

Разрыв в производительности может оказаться не таким уж и критичным. Модели ИИ не обучаются и в большинстве случаев уже не работают на одном GPU или NPU. Более важным фактором часто является эффективность масштабирования платформы.

Новейшие системы Nvidia и AMD содержат 72 GPU в одной вычислительной платформе серверного масштаба, которую можно расширить до 576 с помощью оптических интерконнектов для масштабирования и распределения сети.

Для своих будущих ускорителей серии 960 Huawei идет похожим путем, используя технологию Near Packaged Optics (NPO) для масштабирования своего вычислительного домена до 4096 чипов, способных обеспечить до 16 эксафлопс вычислительной мощности FP4.

То, чего Huawei не хватает в плотности вычислений, она компенсирует масштабом — тактика, которую мы ранее видели у Google TPU pods. Это никого не должно удивлять, учитывая, что высокоскоростные сети — это хлеб с маслом Huawei.

Мы более подробно рассмотрели технологию NPO от Huawei ранее на этой неделе, но, в двух словах, она решает основную проблему масштабирования и точку отказа, присущую предыдущим разработкам Huawei — подключаемые оптические модули потребляют много энергии, склонны к сбоям и занимают много места.

Huawei заявляет, что NPO позволила ей консолидировать 48 000 оптических модулей 800 Гбит/с в 5 500 своих блоков Hi-One NPO, сократив энергопотребление на 550 киловатт и снизив частоту отказов вдвое. Используя новую технологию, компания утверждает, что теперь может достичь 99,8% времени безотказной работы.

Это, вероятно, долгожданная новость для китайских разработчиков моделей, находящихся под давлением необходимости использовать отечественные альтернативы западному оборудованию. Сообщается, что DeepSeek столкнулся с проблемами при использовании предыдущих NPU Huawei для обучения и в конечном итоге был вынужден вернуться к GPU Nvidia.

Ascend 960PR

Наряду с высокопроизводительным 960DT от Huawei, компания также готовит оптимизированную по вычислительной мощности версию чипа под названием 960PR к выпуску позже (в третьем квартале) 2027 года.

Во многих отношениях этот чип выполняет роль, аналогичную той, которую предназначались для ускорителей Nvidia Rubin CPX, прежде чем они были отменены ранее в этом году.

PR в названии 960PR, по-видимому, относится к prefill и рекоммендерам, и Huawei меняет объем памяти и пропускную способность на существенное увеличение производительности при низких точностях. В частности, вариант PR будет иметь до 8 петафлопс производительности FP4, 192 ГБ памяти, которую, как мы полагаем, является собственной разработкой HiBL, обеспечивающей пропускную способность 2,4 ТБ/с.

Насколько нам известно, чип предназначен для совместной работы с DT-чипами Huawei для повышения производительности при выводе LLM. Вычислительно интенсивная фаза prefill конвейера вывода, где обрабатываются запросы, передается 960PR, в то время как память-интенсивная фаза decode, где фактически генерируются выходные токены, выполняется на 960DT.

Такая гетерогенная архитектура оказалась весьма эффективной для повышения производительности и не отличается от конфигурации, используемой в системах Nvidia Vera Rubin и Groq LPX, которые мы рассматривали на GTC этой весной. Основное отличие заключается в том, что у Huawei пока нет ускорителя decode с большим объемом SRAM.

Huawei нацеливается на миллион NPU-кластеров, еще более быстрый ИИ

На конференции Connect Huawei заявила о своем намерении масштабировать свои вычислительные кластеры до полумиллиона и более NPU.

В качестве доказательства концепции компания объявила об успешном масштабировании своего суперкластера TaiShan на базе Ascend 950 до 4096 ускорителей. Используя двухуровневую, четырехплоскостную топологию сети Clos, компания ожидает, что вскоре сможет поддерживать кластеры с числом NPU до 512 000, а при переходе к многоканальной топологии считает, что суперкластеры с миллионом NPU вполне достижимы.

Насколько мы можем судить, это лишь теоретическая конфигурация, а не то, что компания фактически доказала на практике.

Huawei также представила следующие два поколения своих ускорителей Ascend, которые, как и следовало ожидать, обещают стабильный прирост производительности, больше памяти и более быстрые интерконнекты для их объединения.

Части серии Ascend 970, выпуск которых запланирован на 2028 год, обещают до 3,6 петафлопс FP8 или 14 петафлопс FP4 — Huawei, по-видимому, выделяет больше площади кристалла для типов данных с низкой точностью, что мы также видели в последних поколениях чипов AMD и Nvidia.

При объеме 288 ГБ емкость памяти не сильно изменится по сравнению с серией 960, но Huawei утверждает, что ожидает увеличить пропускную способность памяти до 14,4 ТБ/с, что должно значительно улучшить производительность при выводе ИИ.

К 2029 году Huawei ожидает удвоить производительность до 7,2 петафлопс FP8 и 28 петафлопс FP4, одновременно увеличив емкость памяти до 384 ГБ и пропускную способность памяти до 38,4 ТБ/с. Тем не менее, три года — это долгий срок, и мы не удивимся, если к тому времени произойдут существенные изменения в дорожной карте Huawei. ®

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: