Google Gemini 3.8: живое фоновое мышление от Digi

Gemini Google ии голосовые модели обработка речи Synthid neowin.net

Новые голосовые модели обеспечивают одновременную обработку речи и выполнение задач, оснащены аудиоводяными знаками SynthID и автоматическим определением множества языков. Интегрируйте их через API и партнерские платформы.

Google только что запустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые обеспечивают почти мгновенное рассуждение, одновременную обработку речи и мыслей, а также выполнение фоновых инструментов. Модели доступны через API для разработчиков и потребительские платформы.

Эти модели уже начали развертываться. Например, Gemini 3.8 Live немедленно доступна в Gemini API, Google AI Studio, в закрытом корпоративном предварительном просмотре в Gemini Enterprise и в Search Live. Что касается Gemini 3.8 Live Extended Thinking, то она доступна в Gemini API, Google AI Studio, корпоративном предварительном просмотре, а также для подписчиков в Google Workspace (Docs, Gmail, Keep) и Gemini Live. Она демонстрирует лучшие в своем классе результаты тестов, включая оценку 82,6 по индексу качества речи в речь от Artificial Analysis.

Gemini 3.8 Live также заняла второе место в Speech Agent Arena, в то время как Gemini 3.8 Live Extended Thinking получила 68,6% на T-Voice, 35,1% на бенчмарке Sierra T-Voice-banking и 97,7% на Big Bench Audio.

Одно из действительно хороших преимуществ этих моделей заключается в том, что они выполняют вызовы инструментов и API в фоновом режиме, продолжая разговор. Это позволяет им поддерживать беседу с пользователями, одновременно завершая задачи в фоновом режиме, обеспечивая более естественное взаимодействие без постоянных прерываний, когда модель ищет информацию в интернете.

Модели включают расширенные функции, такие как автоматическое определение и переключение между 97 языками в середине разговора, визуальное привязывание почти в реальном времени и ранние вербальные сигналы, такие как «Позвольте мне проверить это…» во время выполнения задач, требующих длительного обдумывания.

Разработчики теперь могут интегрировать новые модели и через партнерские платформы, такие как Agora, LiveKit, Vercel, Pipecat, Fishjam и Vision Agents. Google также подтвердила, что весь сгенерированный аудиоконтент включает невидимые водяные знаки SynthID, чтобы его можно было обнаружить в дезинформации, что является растущей проблемой с появлением ИИ.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: