DeepSeek выпустила свою первую нативную мультимодальную модель. DeepSeek-V4-Flash-Vision-Exp появилась на Hugging Face 31 августа под лицензией MIT, что стало первым случаем поддержки ввода изображений наряду с текстом в серии V4.
Релиз включает файлы модели, токенизатор, эталонную реализацию кодирования промптов и минимальную реализацию инференса на PyTorch, охватывающую кодировщик изображений, выравниватель, DFlash attention, слой маршрутизации смеси экспертов, Hyper-Connections и модули DSpark. DeepSeek пометила веса как экспериментальную сборку “Exp”; модель доступна через DeepSeek API с 21 августа.
Возможности зрения позволяют модели описывать изображения, читать текст на скриншотах и анализировать диаграммы, принимая на вход JPEG, PNG, GIF и WebP. На чисто текстовых задачах — агенты, рассуждения и знания о мире — компания заявляет, что производительность находится на уровне релизной версии V4-Flash, сохраняя прежние сильные стороны. На бенчмарках для агентов, требующих визуального понимания, модель значительно превосходит V4-Flash и приближает возможности мультимодального агента к Claude Opus 4.8.
Открывая исходный код стека инференса вместе с весами, DeepSeek позиционирует модель для интеграции в различные агентные фреймворки и инструменты, расширяя свою стратегию открытых весов с текста на работу с изображениями. Для разработчиков и предприятий релиз снижает барьер для развертывания конкурентоспособной модели с поддержкой зрения локально или на стандартной инфраструктуре, что соответствует общей тенденции в отрасли к экономичным и настраиваемым открытым моделям.
Модели с поддержкой зрения стали центральными на рынке AI-агентов, поскольку разработчики сочетают скриншоты и изображения из реального мира с рассуждениями. Шаг DeepSeek следует шаблону всё более открытых мультимодальных релизов китайских лабораторий, которые используют разрешительные лицензии и агрессивное ценообразование для внедрения на платформах разработчиков США, в облачных каталогах и корпоративных меню моделей. Поскольку модель легковесна для весов frontier-класса и поставляется с минимальным эталонным инференсом, команды могут быстро развернуть её без проприетарных инструментов оркестрации.
Компания заявила, что продолжит итерации линейки V4, причём сборка vision-exp служит средством валидации архитектурных решений — компонентов выравнивателя, DSpark и Hyper-Connections — перед более широким мультимодальным релизом. Пока экспериментальный флаг сигнализирует об осторожности: распознавание и понимание диаграмм сильны, но DeepSeek рекомендует тестировать на конкретных задачах, а не предполагать производственное поведение для всех задач с изображениями. Ранние пользователи, от исследовательских групп до разработчиков приложений, используют открытый стек, чтобы оценить, сохраняются ли навыки мультимодального агента, близкие к Opus, в их собственных пайплайнах.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




