iFLYTEK выпустила Spark-ASR-2.0 для сценариев с шумом, диалектами и смешанной англо-китайской речью

Iflytek Spark-Asr-2.0 распознавание речи ии Llm Api pandaily.com

iFLYTEK выпустила Spark-ASR-2.0 для распознавания речи в условиях шума, с диалектами и смешанной китайско-английской речью. Планируется интеграция в iFLYTEK Input и открытие API. Стоимость инференса выросла всего на 10% по сравнению с версией 1.0.

23 сентября 2026 года компания iFLYTEK представила Spark-ASR-2.0 — свою новейшую большую модель распознавания речи, ориентированную на работу в условиях шума, с диалектами, при низкой громкости и в сценариях смешанной китайско-английской речи, согласно iFeng Tech и соответствующим обзорам продуктов. Официальное английское название бренда — iFLYTEK / iFLYTEK Spark. Данный обзор посвящен продукту и технологии распознавания; информация о фондовом рынке или финансах из второстепенных источников выходит за рамки.

По заявлению компании, по сравнению с Spark-ASR-1.0, процент ошибок распознавания слов снизился в общем распознавании (смешанная речь, диалекты, доменные термины), при сложных акустических условиях (высокий уровень шума, тихая речь, быстрая речь, дети), в контекстном распознавании и нормализации текста, в то время как стоимость инференса выросла всего примерно на 10 процентов. Позиционирование смещается от дословной транскрипции к плавному изложению: сокращение пауз и улучшение пунктуации, чисел, символов и единиц измерения, чтобы выходные данные представляли собой готовый текст, подходящий для сообщений или заметок. Материалы компании утверждают о преимуществах перед ведущими конкурентами, особенно в отношении диалектов, высокого уровня шума и низкой громкости; эти сравнения остаются на уровне заявлений поставщика.

Архитектура сочетает неавторегрессивное распознавание с авторегрессивной коррекцией, усиленной LLM — спекулятивное декодирование определяет, когда и где вмешивается ветвь LLM — плюс совместное китайско-английское текстовое/акустическое обогащение для редких данных смешанной речи и динамическая инъекция контекста из истории коррекции, многоходовой памяти и библиотек ключевых слов, извлеченных из больших пулов кандидатов. Покрытие диалектов описано как распознавание без переключения для 202 китайских городов, с улучшенной обработкой медицинских, химических и научных терминов. Планы внедрения включают постепенную интеграцию в iFLYTEK Input с 24 сентября, открытый API на открытой платформе iFLYTEK с общедоступным демонстрационным входом, а также последующее использование в умных очках, интеллектуальных офисных блокнотах и продуктах для транскрипции iFLYTEK Tingjian в потребительском и корпоративном сегментах.

Заметки из дорожной карты компании отмечают отклонение говорящего в условиях многопользовательского шума, редактирование контента с помощью голоса и форматирование с учетом эмоций как следующие целевые области улучшения пользовательского опыта. В совокупности Spark-ASR-2.0 представляет собой конкретное обновление продукта ASR для китайских сценариев с шумом, большим количеством диалектов и смешанной речью — это не финансовая новость, меняющая рынок.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: