Новейшая модель Google Gemini для распознавания речи предлагает целый ряд новых функций

Gemini ии речь транскрибация Google модель neowin.net

Google выпустил Gemini 3.5 Transcribe — самую точную модель распознавания речи. Она лучше обрабатывает шум, жаргон и исправляет ошибки. Доступна в 85 языках для разработчиков и пользователей Android, macOS и Chrome.

Google анонсировал ещё одну модель ИИ — Gemini 3.5 Transcribe, обновление своей модели преобразования речи в текст в семействе Gemini. Поисковый гигант называет Gemini 3.5 Transcribe своей самой точной моделью в этой категории на сегодняшний день.

Новая модель легче справляется с фоновым шумом и сложным жаргоном. Google сообщил, что уже заметил улучшение производительности в приложении Gemini на macOS и функции Rambler в Gboard на Android благодаря новой модели. Кроме того, разработчики могут использовать её для создания голосовых агентов, инструментов субтитров в реальном времени или конвейеров анализа постзвонковых данных.

«Gemini 3.5 Transcribe создана для передачи вашего естественного стиля речи, чтобы лучше понимать ваши намерения и распознавать пользовательский словарь, что позволяет выполнять задачи с помощью голоса», — говорится в блоге Google.

Новая модель ИИ оснащена набором новых функций для улучшения своих результатов. Например, она может самостоятельно вносить исправления, удалять слова-паразиты и автоматически форматировать текст. Она также может делегировать сложные задачи, такие как анализ файлов и генерация изображений, другим моделям Gemini.

Google отмечает, что Gemini 3.5 Transcribe обеспечивает более точную транскрибацию со «средним показателем частоты ошибок в словах (WER) 4,0% для потоковой передачи и 2,6% для непотоковых сценариев». Модель показывает лучшие результаты в шумной обстановке и точно распознаёт буквенно-цифровые сущности, такие как идентификаторы заказов и почтовые индексы.

Новейшая модель Google Gemini для распознавания речи предлагает целый ряд новых функций
Изображение: Google

Gemini 3.5 Transcribe доступна на 85 языках с поддержкой региональных акцентов и различных диалектов. Она может приписывать речь в предварительно записанном аудио с временными метками для трёх говорящих, адаптироваться к вашему пользовательскому словарю, а также распознавать специализированный жаргон и уникальные написания.

Google сообщил, что Gemini 3.5 Transcribe доступна разработчикам в публичной предварительной версии в Gemini API через Google AI Studio и Google Antigravity. Обычные пользователи могут опробовать её на Android и macOS, а вскоре она появится и в Google Chrome, где можно будет говорить, чтобы печатать в любом веб-поле.

Говоря о Gemini в целом, поисковый гигант недавно выпустил Gemini 3.7 Flash и вступил в ценовую войну ИИ. Gemini в Chrome для Android стала доступна всем пользователям в США, а ИИ-ассистент также добрался до новых роботакси Waymo.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: