На конференции Apsara 2026 компания Alibaba представила новую линейку мультимодальных речевых и аудиорешений, возглавляемую Qwen3.8-LiveTranslate и семейством продуктов Qwen-Audio-3.1, согласно англоязычному пресс-релизу Alibaba Cloud от 22 сентября. Официальный английский бренд — Alibaba / Qwen. Акцент сделан на спецификациях аудиопродуктов — задержке, распознавании, синтезе и взаимодействии в реальном времени, а не на дорожных картах обучения или инфраструктуре агентов и облака, представленных на той же неделе.
Qwen3.8-LiveTranslate позиционируется как модель синхронного перевода, нацеленная на повышение точности, беглости и краткости перевода. Alibaba утверждает, что модель сокращает задержку, измеряемую по LAAL, почти на 20 процентов — с примерно 2,8 до 2,3 секунды, обеспечивая более плавный перевод в реальном времени. Эти показатели задержки, представленные компанией в материалах Apsara, являются основным заявлением о характеристиках продукта, не зависящим от оборудования.
Наряду с LiveTranslate, Alibaba представила Qwen-Audio-3.1-TTS-Next — модель генерации аудио следующего поколения, способную создавать полноценные кинематографические звуковые ландшафты, смешивая диалоги и фоновые звуки из одного текстового сценария. Среди целевых сценариев использования, указанных в релизе, — аудиокниги, кино и телевидение, подкасты и игры, то есть творческое производство, а не только ответы ассистентов.
Более широкий пакет речевых технологий также включает Qwen-Audio-3.1-ASR для автоматического распознавания речи, Qwen-Audio-3.1-TTS для преобразования текста в речь и Qwen-Audio-3.1-Realtime для интерактивного голоса с низкой задержкой. Вместе эти компоненты охватывают пути понимания, генерации и взаимодействия в реальном времени, а не один SKU чат-бота. Упоминания о визуальной составляющей в том же релизе, такие как Qwen-Image 3.1, запланированный на конец этого года, выходят за рамки данного обзора аудиорешений, как и предыдущие версии для изображений и универсальные решения, которые уже были освещены отдельно. Для команд разработчиков, оценивающих китайские решения в области голосового ИИ, результатом Apsara является заявленное сокращение задержки LiveTranslate и стек Audio-3.1 из четырех продуктов с явным вариантом TTS-Next для творческих задач.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




