30 сентября DeepSeek открыл исходный код набора инфраструктурных компонентов для вычислительной платформы Huawei Ascend, включающий поддержку Ascend для языка программирования ядра TileLang, библиотеки вычислительных ядер и библиотеку распределенных вычислений. Компания заявила, что каждый компонент соответствует библиотекам, ранее выпущенным для графических процессоров NVIDIA, поэтому разработчики могут использовать одни и те же инструменты на обеих платформах. Релиз выходит за рамки адаптации моделей, затрагивая программное обеспечение, от которого зависят собственные обучение и инференс DeepSeek.
В центре внимания — TileLang. DeepSeek утверждает, что он упрощает код по сравнению с CUDA, при этом используя особенности чипа, и уже реализует большинство операторов, используемых для обучения его серии V4. Версия для Ascend включает низкоуровневые инструкции Ascend C, и каждый оператор TileLang, используемый DeepSeek при обучении, теперь имеет высокопроизводительную реализацию для Ascend. Компания надеется, что этот порт послужит шаблоном для программных экосистем на других ИИ-чипах.
DeepGEMM-Ascend для матричных умножений совместим по API с оригинальным DeepGEMM и поддерживает BF16, FP8 и FP4 на устройствах Ascend 950. TileKernels работает через один Python-интерфейс как на GPU, так и на NPU Huawei, FlashMLA обрабатывает разреженное внимание, а DeepSelect обеспечивает выборку top-k для индексации и выборки внимания. DeepEP-Ascend обрабатывает межкомпонентное взаимодействие expert-parallel all-to-all для моделей mixture-of-experts. На NPU Ascend 950DT, согласно странице на GitHub, пропускная способность при отправке FP8 составляет от 373 до 375 ГБ/с, а комбинированная пропускная способность — от 345 до 347 ГБ/с при EP8, что, по словам DeepSeek, приближается к аппаратным пределам. Эти показатели были получены с использованием пакета прошивки proof-of-concept; DeepSeek направляет пользователей к коммерческому релизу Huawei, запланированному примерно на 15 октября.
Huawei, которую DeepSeek поблагодарил за безоговорочную поддержку, заявила, что предоставила совместно определенный супернод SuperPoD Flex и схему сетевого взаимодействия UBL128, которые предлагают одноранговую масштабируемую сеть на 128 карт с пропускной способностью 3,2 Тбит/с и двухранговую масштабируемую сеть, достигающую 256 тыс. карт, а также библиотеку ASC-COMM для пользовательских операторов связи. Huawei опубликовала совместную работу в своем сообществе CANN в виде рецептов, охватывающих низколатентный инференс с большим количеством экспертов (large-EP), развертывание на одной карте и одном узле, крупномасштабное обучение, кэширование KV с большим контекстом и обучение с подкреплением на основе агентов.
В автономных тестах с конфигурацией EP32 и контекстом 128 тыс. Huawei сообщает, что DeepSeek-V4.1-Flash достиг скорости 2469 выходных токенов в секунду на карту при 5 мс на выходной токен и 5102 токенов в секунду при 10 мс, не учитывая планирование обслуживания и балансировку нагрузки фреймворка. В анонсе не указано, что V4 завершил полномасштабное обучение на Ascend.
СМ. ТАКЖЕ:Huawei открывает исходный код обучения openPangu-2.0 на Ascend · Сообщество open-source Huawei Ascend CANN · Планы DeepSeek по кластеру инференса Ascend 950DT
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




