Компания Cambricon сообщила о завершении адаптации модели DeepSeek-V4.1-Flash на открытом стеке для инференса vLLM в день её релиза (Day-0 adaptation). Это означает, что новая модель может стабильно работать на ускорителях Cambricon в тот же день, когда DeepSeek опубликовала контрольную точку. Анонс касается аппаратного и программного обеспечения: одновременная доступность модели и чипа, а также зрелость платформы Cambricon NeuWare и пути vLLM, а не повторение информации об общей доступности модели, которая уже освещалась в других источниках.
DeepSeek-V4.1-Flash — это самый компактный представитель нового семейства архитектур DeepSeek. Модель с 552 миллиардами параметров использует архитектуру mixture-of-experts, активируя около 8 миллиардов параметров на стороне ввода и 16 миллиардов на стороне вывода, а также обладает нативной поддержкой мультимодального понимания изображений. DeepSeek подчеркивает использование архитектуры Causal-Encoder-Decoder и агрессивное сжатие KV-кэша, которое снижает потребность в HBM примерно до четверти и в SSD — до одной восьмой по сравнению с предыдущим поколением. Размер кэша описывается как в сотни раз меньший, чем у дизайна первого поколения. Экономия памяти важна для поставщиков ускорителей, стремящихся контролировать задержку инференса, потребление DRAM и уровни хранения на плотных серверах, которые уже испытывают нагрузку на бюджеты HBM.
Со стороны Cambricon инженеры использовали библиотеку слияния операторов Torch-MLU-Ops для ускорения таких структур, как Engram и Compressor, и написали оптимизированные ядра на языке BangC для узких мест разреженного и сжатого внимания. Внутри vLLM Cambricon заявляет о поддержке пятимерного смешанного параллелизма, охватывающего тензорный, конвейерный, последовательный, параллелизм данных и экспертов, с перекрытием коммуникаций и вычислений, низкоточным квантованием и разделением этапов prefill и decode для повышения общей пропускной способности. Этот стек базируется на NeuWare, давней программной платформе компании. Днями ранее Cambricon присоединилась к PyTorch Foundation в качестве платинового члена, войдя в управляющий совет вместе с другими крупными поставщиками аппаратного обеспечения и облачных решений, что сигнализирует об углублении инвестиций в открытые инструменты для обучения и инференса.
Теперь Cambricon поддерживает Day-0 или производственный инференс для пяти основных китайских модельных линеек — GLM, DeepSeek, Qwen, Kimi и MiniMax — от компаний Zhipu AI, DeepSeek, Alibaba, Moonshot AI и MiniMax. Издание Caixin Global отдельно отметило одновременное включение Cambricon как признак того, что внутренние циклы разработки моделей и чипов сокращаются с нескольких месяцев частных портов до готовности к запуску в день релиза на общедоступных фреймворках, которые операторы уже используют в качестве стандарта.
Для операторов кластеров практический вывод заключается в одновременной доступности: когда выходит передовая открытая модель, клиенты Cambricon могут использовать документированный рецепт vLLM вместо ожидания закрытого форка. Будет ли этот путь Day-0 применим к более крупным вариантам DeepSeek и мультимодальным конфигурациям инференса, станет следующим испытанием для программной экосистемы.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




