Компания Ant Group выпустила и открыла исходный код Ling-3.0-flash-VL — первой нативной мультимодальной модели в линейке Ling — через организацию inclusionAI на платформах Hugging Face и ModelScope. Модель построена на основе архитектуры Ling-3.0-flash mixture-of-experts, содержит 124 миллиарда параметров, при этом активируя около 5,5 миллиардов на токен. Она принимает на вход изображения, текст и видео, имеет контекстное окно объемом 256 тыс. токенов для длинных документов и видео. Веса BF16 и FP8 были опубликованы 9 сентября, а сборки FP4 и INT4 планируются вскоре после этого.
Ключевой особенностью является цикл обратной связи по зрению (vision feedback loop), который рассматривает визуальное восприятие как часть непрерывного рабочего процесса, а не как однократный шаг для создания подписей. Модель получает инструкции наблюдать, действовать, проверять и корректировать результаты на основе визуальных или отрисованных исходов. Ant Group позиционирует ее для автоматизации графических интерфейсов, генерации фронтенд-кода и чтения медицинских отчетов. В тестах «изображение в веб-страницу» модель, как сообщается, восстанавливает структуру макета и взаимосвязи компонентов, а затем корректирует сгенерированный код после сравнения результатов рендеринга. Под псевдонимом linthium в рамках Image-to-WebDev Arena, Ant Group заявляет, что результат превзошел GPT-5.4. В качестве агента для графических интерфейсов модель способна анализировать структуру интерфейса и выстраивать цепочки межсервисных действий; в сценариях работы с клиническими отчетами она предназначена для консолидации данных из разных документов и выявления рисков, а не только для краткого изложения содержания одной страницы.
Ant Group утверждает, что совместное нативное мультимодальное обучение улучшило как текстовые, так и визуальные способности модели. В рейтинге Artificial Analysis Intelligence Index v4.1.1 модель Ling-3.0-flash-VL получила 42 балла, что на четыре пункта выше, чем у чисто текстовой модели Ling-3.0-flash. Материалы Hugging Face группируют задачи оценки по категориям: понимание, рассуждение и действие — для сложных макетов и документов, многошаговые проверки на основе доказательств и выполнение задач, управляемых интерфейсом. Такая структура соответствует ставке на то, что открытые мультимодальные веса помогут агентам замыкать циклы в программных и клинических рабочих процессах, а не только отвечать на статические визуальные вопросы.
Архитектура сочетает в себе энкодер изображений произвольного разрешения и двухслойный проектор с временным кодированием VideoRoPE, а затем 42-слойный гибридный языковой модуль, чередующий блоки KDA и MLА с вентилями в соотношении 5:1. Архитектура Sparse MoE поддерживает низкий уровень активируемых вычислений для многопользовательских визуальных чатов и агентов с долгосрочной историей. Живые демонстрации доступны в Ling Studio. Рецепты для SGLang и форк vLLM, настроенный для Ling, документированы вместе с весами, включая парсеры для рассуждений и вызовов инструментов, настроенные для шаблона чата Ling-3.
Для разработчиков открытый выпуск имеет значение не столько как еще один инструмент для создания подписей, сколько как первый открытый стек Ling для мультимодальных задач, интегрирующий зрение в планирование и верификацию для агентских задач. Это также первый открытый релиз Ling, который предлагает нативный мультимодальный путь с явным циклом обратной связи по зрению, а не с прикрепленным модулем зрения.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




