OpenAI выпустила API для своей новейшей модели голосового общения в реальном времени с полнодуплексной связью, что позволит разработчикам программного обеспечения создавать более отзывчивые приложения с голосовым управлением и диалоговые рабочие процессы.
GPT-Live-1 дебютировала в июле, предложив способ взаимодействия с помощью голосовых запросов и ответов вместо ввода текста. Изначально доступная через интерфейс ChatGPT, голосовая модель теперь может быть вызвана через API-запросы.
Являясь полнодуплексной моделью, GPT-Live-1 может одновременно слушать и генерировать речь, что способствует плавному общению. Люди часто перебивают друг друга и могут испытывать разочарование, когда приходится по очереди говорить и слушать, как при использовании полудуплексных портативных радиостанций.
OpenAI заявляет, что сосредоточилась на предоставлении разработчикам, внедряющим GPT-Live-1, возможности настраивать взаимодействие пользователей бизнес-приложений с голосом и связанные с этим рабочие процессы.
“Ключевое преимущество GPT‑Live‑1 — плавное прерывание диалога — уже приносит пользу бизнесу: по предварительным оценкам, Speak обнаружил, что GPT‑Live‑1 дает учащимся больше времени на размышления перед ответом преподавателя языка, сокращая количество прерываний почти на 80 процентов по сравнению с предыдущими пошаговыми системами”, — говорится в сообщении компании.
GPT-Live-1 предназначена для ведения голосового диалога, в то время как серверная модель (например, GPT-6 Astra или более доступный вариант для рутинных задач) обрабатывает поиск информации, использование инструментов и управление задачами.
Это шаг вперед по сравнению с Realtime API от OpenAI, дебютировавшей в 2024 году. В бенчмарке голосовых агентов Tau3, который оценивает задачи обслуживания клиентов по телефону, актуальные для авиакомпаний, розничных продавцов и телекоммуникационных компаний, GPT-Live-1 набирает 86,2 процента, по сравнению с 45,7 процента у GPT-Realtime-2.1 и 42,4 процента у GPT-Realtime-2.
Ссылаясь на собственные оценки, OpenAI заявила, что GPT-Live-1 работает на 30 процентов лучше, чем GPT-Realtime-2.1, в тесте Full Duplex Bench, а также превосходит своего предшественника по задержке при смене реплик и интерактивному поведению.
Yelp использует GPT-Live-1 для сервиса Yelp Host и положительно отзывается о технологии применительно к системе бронирования ресторанов компании с использованием ИИ.
“С GPT-Live-1 каждый звонок становится более диалоговым и отзывчивым”, — заявил Ахил Кудувалли Рамеш, директор по продуктам Yelp, в заявлении. “Yelp Host теперь предоставляет ресторанам продвинутый голосовой ИИ, который обеспечивает исключительный опыт для гостей, позволяет использовать возможности получения дохода, которые в противном случае могли бы быть упущены, и помогает персоналу сосредоточиться на обслуживании гостей, а не на ответах на телефонные звонки”.
Yelp не уточняет, приветствуют ли клиенты ресторанов, делающие заказы, более свободное общение с роботом или просто принимают его, потому что это лучше, чем ждать на линии, чтобы поговорить с человеком.
GPT-Live-1 стоит 0,05 доллара США за минуту использования, в дополнение к любой серверной модели, которая работает. Пользовательские голоса могут быть согласованы с отделом продаж OpenAI. Голосовая модель также доступна через OpenAI Presence — корпоративную платформу агентов компании. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Thomas Claburn




