OpenAI наконец-то исправила главный недостаток голосовых чатов с ИИ: вот как

Openai Gpt-Live Chatgpt голосовой интерфейс Webrtc Full-Duplex androidheadlines.com

Откройте для себя GPT-Live от OpenAI: полнодуплексный WebRTC, мгновенные соединения и непрерывная речь без пауз. Узнайте, как новая архитектура меняет голосовое взаимодействие с ChatGPT.

Если вы когда-либо пользовались голосовым помощником на базе искусственного интеллекта, вам знаком раздражающий ритм: вы говорите, ждёте короткой паузы, надеетесь, что приложение поймёт, что вы закончили фразу, а затем сидите в заметной тишине, пока оно обрабатывает ответ. OpenAI официально кладёт конец этой неловкой динамике, полностью перестроив свою голосовую инфраструктуру с нуля — под названием GPT-Live.

Компания изначально анонсировала GPT-Live в начале этого месяца. Теперь в подробном инженерном посте и серии обновлений инженеры OpenAI Джастин Уберти и Захан Малкани рассказали, как шестимесячная перестройка превратила ChatGPT Voice из системы с поочерёдной передачей речи в плавный, full-duplex разговорный опыт.

Отказ от детекторов пауз в пользу непрерывной речи

Ранние версии ChatGPT Voice полагались на небольшие вспомогательные модели, известные как «детекторы пауз». Эти детекторы должны были угадывать, когда пользователь перестаёт говорить, прежде чем запустить обработку речи. Слишком раннее угадывание приводило к тому, что пользователя перебивали на полуслове, а слишком позднее создавало неестественную, неловкую тишину.

GPT-Live полностью отказывается от такого подхода. Новая full-duplex архитектура обрабатывает входящее аудио, одновременно генерируя исходящую речь. Вместо ожидания статичных пауз модель непрерывно несколько раз в секунду решает, стоит ли слушать, говорить, делать паузу или позволить вам прервать её.

OpenAI наконец-то исправила главный недостаток голосовых чатов с ИИ: вот как

Быстрый путь для разговора, фоновый путь для размышлений

Чтобы разговоры проходили плавно без задержек, OpenAI разделила систему на два отдельных уровня. Аудиопотоки между вашим устройством и моделью GPT-Live передаются по выделенному быстрому пути с низкой задержкой. Тем временем более тяжёлые задачи — такие как поиск в интернете, выполнение кода или обращение к передовым моделям вроде GPT-5.5 для глубоких рассуждений — выполняются вне живого аудиопотока через асинхронную границу.

Это означает, что если GPT-5.5 потребуется несколько дополнительных секунд для решения сложного математического запроса или проверки календаря, голосовой слой может продолжать естественный разговор без потери кадров, заиканий или заморозки соединения.

Перестройка транспортного уровня для мгновенных соединений

OpenAI должна была обеспечить надёжную работу системы для более чем 150 миллионов еженедельных голосовых пользователей. С учётом этого технологическая лаборатория заменила старый код на Python asyncio на Go, добившись гораздо более стабильной доставки кадров.

Команда также решила проблему задержек при установке соединения. Традиционные настройки WebRTC требуют до шести сетевых циклов только для начала потоковой передачи аудио. OpenAI разработала новую открытую спецификацию под названием WARP (WebRTC Abridged Roundtrip Protocol) вместе с функцией Instant Connect. Вместе они сжимают эту последовательность запуска до одного сетевого пакета, позволяя пользователям запускать живую голосовую сессию практически мгновенно.

В целом, разделив мгновенную речь и тяжёлые размышления, OpenAI создала голосовой интерфейс, который наконец-то ощущается как разговор с человеком, а не как работа с рацией.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: