DeepSeek-V4.1-Flash: Каузальный энкодер-декодер MoE с контекстом 1М и экстремальным KV-сжатием

ии модели Moe контекст инференс Deepseek pandaily.com

DeepSeek представляет V4.1-Flash: 552B MoE с причинным энкодером-декодером и 1М контекстом. Используйте CSA2+FP4 KV (890 байт/токен) и API deepseek-flash для эффективного инференса.

Компания DeepSeek выпустила модель DeepSeek-V4.1-Flash — мультимодальную модель Mixture-of-Experts (MoE) с 552 миллиардами параметров, построенную на основе архитектуры Causal Encoder–Decoder и имеющую контекстное окно объемом один миллион токенов. Компания позиционирует модель как наименьший представитель нового семейства архитектур, нацеленный на более высокие пределы возможностей, ускоренное декодирование и увеличенную пропускную способность при развертывании. Доступ к модели предоставляется через API под названием deepseek-flash.

Стек Causal Encoder–Decoder использует 40-слойный Transformer, разделенный на 20-слойный причинный энкодер и 20-слойный декодер. При презаполнении активируется около 8 миллиардов параметров на токен, а при декодировании — около 16 миллиардов. Таким образом, рабочие нагрузки агентов с большим объемом входных данных обходятся дешевле, чем симметричные конструкции MoE аналогичного размера. Compressed Sparse Attention 2 (CSA2) назначает режимы Full, Reindex или Reuse для разных слоев, а основное кеширование KV с использованием FP4 сокращает глобальный объем KV примерно до 890 байт на токен — примерно на четверть по сравнению с DeepSeek-V4-Flash, в то время как SWA Bounded Replay снижает потребность в постоянном кешировании KV на SSD примерно до одной восьмой.

Обучение охватило около 45 триллионов мультимодальных токенов, с использованием разреженного внимания для последовательностей длиной 64 тыс. и расширением контекста до 1 млн на более поздних этапах предварительного обучения. Последующее обучение включает контролируемое дообучение (supervised fine-tuning), обучение с подкреплением (reinforcement learning) и дистилляцию на основе политики (on-policy distillation), с активным использованием автоматического синтеза задач для агентов. На бенчмарках агентных инструкций при максимальном уровне вычислительных усилий DeepSeek демонстрирует результаты: Terminal-Bench 2.1 — 90,6, DeepSWE v1.1 — 74,2 и AutomationBench — 54,8, наряду с нативной обработкой изображений через энкодер DeepSeek-ViT, разработанный с нуля.

Веса модели и рецепты для инференса опубликованы на Hugging Face под лицензией MIT. DeepSeek заявляет о поддержке сторонних адаптеров для инференса при масштабном развертывании. Старые псевдонимы V4 Flash временно перенаправляют на V4.1-Flash; DeepSeek также планирует отказаться от маршрутизации V4 Pro в пользу нового SKU Flash. Основной акцент делается на архитектурной и экономически эффективной обработке длинного контекста при инференсе, а не на геополитике. В центре внимания — сжатие KV и асимметричная активация, которые делают сессии агентов с миллионным контекстом дешевле в обслуживании.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: