Команда Qwen от Alibaba представила Qwen3.8-Omni-Flash — нативную омнимадальную модель, которая совместно обрабатывает текст, изображения, аудио и видео с контекстным окном в 1 миллион токенов. Модель доступна на платформе Qwen AI с 18 сентября и позиционируется не столько как демонстрация генерации подписей, сколько как стек агентов для длительных аудиовизуальных рабочих процессов — планирование задач, вызов инструментов и предоставление готовых медиаресурсов.
На наборе из примерно 30 общедоступных и внутренних бенчмарков Qwen3.8-Omni-Flash показала в среднем на 26% более высокие результаты по сравнению с предыдущим поколением Qwen3.5-Omni-Plus. Прирост был особенно значительным в задачах, связанных с агентами для аудио и видео, а также с длительным горизонтом: WildClawBench-MM вырос на 36,5 пункта, AgenticVBench — на 22,3 пункта, а UniClawBench достиг 69,6. Основное восприятие также улучшилось — LongAudioSpan на 8,3 пункта и OmniVideoBench на 9,6, в то время как коэффициент ошибок диаризации / конкатенированный коэффициент ошибок слов AliMeeting снизился с 88,11 / 89,61 до 3,35 / 17,18.
Практическим направлением является понимание длинных видео с помощью агентов. Вместо сканирования каждого кадра модель может решать, что смотреть и слушать, концентрируя токены на релевантных фрагментах. На OmniVideoBench такой режим агента повысил точность с 63,4 до 67,8, сократив при этом использование токенов примерно со 145 736 до 79 117 — примерно на 45,7% меньше токенов. Рабочие процессы совещаний принимают до одного часа аудио-видео входа для разделения дикторов, транскрипции, составления протоколов и последующих действий, таких как отправка электронной почты или написание кода с помощью инструментов.
Для поддержки этих конвейеров Alibaba расширила Qwen-MM-Plugins и выпустила в открытый доступ Qwen-Live Harness для непрерывного мультимодального взаимодействия в реальном времени. Версия Realtime SKU добавляет потоковую передачу с низкой задержкой, устную практику с учетом акцента и пространственные аудиосигналы, которые оценивают направление и расстояние звука. По данным компании, цены API за почасовую обработку аудио были снижены более чем на 98%, а за почасовую обработку аудио-видео — более чем на 93%. Компания позиционирует выпуск как скачок в возможностях и более дешевый путь для продакшн-агентов.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




