DeepSeek открывает исходный код версий Ascend для TileLang, DeepGEMM и DeepEP, пока Huawei детализирует SuperPoD Flex

Deepseek Huawei Ascend ии по Gpu pandaily.com

DeepSeek выпустил версии TileLang, DeepGEMM, DeepEP, TileKernels, FlashMLA и DeepSelect для Ascend, а Huawei представил совместную разработку SuperPoD Flex на 128 карт.

30 сентября DeepSeek открыл исходный код набора инфраструктурных компонентов для вычислительной платформы Huawei Ascend, включающий поддержку Ascend для языка программирования ядра TileLang, библиотеки вычислительных ядер и библиотеку распределенных вычислений. Компания заявила, что каждый компонент соответствует библиотекам, ранее выпущенным для графических процессоров NVIDIA, поэтому разработчики могут использовать одни и те же инструменты на обеих платформах. Релиз выходит за рамки адаптации моделей, затрагивая программное обеспечение, от которого зависят собственные обучение и инференс DeepSeek.

В центре внимания — TileLang. DeepSeek утверждает, что он упрощает код по сравнению с CUDA, при этом используя особенности чипа, и уже реализует большинство операторов, используемых для обучения его серии V4. Версия для Ascend включает низкоуровневые инструкции Ascend C, и каждый оператор TileLang, используемый DeepSeek при обучении, теперь имеет высокопроизводительную реализацию для Ascend. Компания надеется, что этот порт послужит шаблоном для программных экосистем на других ИИ-чипах.

DeepGEMM-Ascend для матричных умножений совместим по API с оригинальным DeepGEMM и поддерживает BF16, FP8 и FP4 на устройствах Ascend 950. TileKernels работает через один Python-интерфейс как на GPU, так и на NPU Huawei, FlashMLA обрабатывает разреженное внимание, а DeepSelect обеспечивает выборку top-k для индексации и выборки внимания. DeepEP-Ascend обрабатывает межкомпонентное взаимодействие expert-parallel all-to-all для моделей mixture-of-experts. На NPU Ascend 950DT, согласно странице на GitHub, пропускная способность при отправке FP8 составляет от 373 до 375 ГБ/с, а комбинированная пропускная способность — от 345 до 347 ГБ/с при EP8, что, по словам DeepSeek, приближается к аппаратным пределам. Эти показатели были получены с использованием пакета прошивки proof-of-concept; DeepSeek направляет пользователей к коммерческому релизу Huawei, запланированному примерно на 15 октября.

Huawei, которую DeepSeek поблагодарил за безоговорочную поддержку, заявила, что предоставила совместно определенный супернод SuperPoD Flex и схему сетевого взаимодействия UBL128, которые предлагают одноранговую масштабируемую сеть на 128 карт с пропускной способностью 3,2 Тбит/с и двухранговую масштабируемую сеть, достигающую 256 тыс. карт, а также библиотеку ASC-COMM для пользовательских операторов связи. Huawei опубликовала совместную работу в своем сообществе CANN в виде рецептов, охватывающих низколатентный инференс с большим количеством экспертов (large-EP), развертывание на одной карте и одном узле, крупномасштабное обучение, кэширование KV с большим контекстом и обучение с подкреплением на основе агентов.

В автономных тестах с конфигурацией EP32 и контекстом 128 тыс. Huawei сообщает, что DeepSeek-V4.1-Flash достиг скорости 2469 выходных токенов в секунду на карту при 5 мс на выходной токен и 5102 токенов в секунду при 10 мс, не учитывая планирование обслуживания и балансировку нагрузки фреймворка. В анонсе не указано, что V4 завершил полномасштабное обучение на Ascend.

СМ. ТАКЖЕ:Huawei открывает исходный код обучения openPangu-2.0 на Ascend · Сообщество open-source Huawei Ascend CANN · Планы DeepSeek по кластеру инференса Ascend 950DT

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: