Huawei openJiuwen обеспечивает WorkSwarm полнодуплексной связью по голосу и видео, готовой к развертыванию на NPU Ascend

Openjiuwen Huawei ии Workswarm мультимодальность ии-агент pandaily.com

Платформа openJiuwen от Huawei получила полнодуплексное мультимодальное взаимодействие в WorkSwarm. Прерывайте агента и продолжайте разговор, пока он выполняет задачи в фоне.

openJiuwen, платформа ИИ-агентов с открытым исходным кодом, разработанная лабораторией Huawei 2012, Huawei Cloud, а также командами по разработке устройств и вычислительных систем компании совместно с университетами и другими разработчиками, добавила полнодуплексное мультимодальное взаимодействие в WorkSwarm — свою рабочую среду с открытым исходным кодом для офисных задач и программирования. Обновление, анонсированное 1 октября, позволяет пользователям общаться с агентом так, как они разговаривали бы по телефону, в то время как отдельный агент продолжает выполнять более длительные задачи в фоновом режиме.

Полнодуплексный режим означает, что помощник может слушать и говорить одновременно. Вместо режима рации, используемого в обычных голосовых помощниках, когда пользователь ждет, пока ИИ закончит, пользователь может прервать ответ на середине, например, попросив его пропустить фоновую информацию и перейти к выводам. Когда WorkSwarm обнаруживает новую допустимую голосовую команду, он прекращает текущий голосовой ответ и обрабатывает новую инструкцию, при этом уже сгенерированный текст остается в журнале задач. Для уменьшения ложных срабатываний от фонового шума используются обнаружение голосовой активности и шумоподавление.

Дизайн разделяет работу на два потока. Модель реального времени отслеживает видеопоток с камеры, слушает и быстро отвечает, в то время как Core Agent разбивает задачи, вызывает инструменты и продвигает их выполнение. Пользователь может навести камеру на продукт, спросить, какой он марки, а затем попросить WorkSwarm исследовать его и составить документ. Поиск выполняется в фоновом режиме во время продолжения разговора, а интерфейс отображает статус задачи, записи вызовов инструментов, результаты и сгенерированные файлы. Когда фоновая задача завершается, WorkSwarm сначала публикует письменное резюме и ждет окончания текущего голосового обмена, прежде чем озвучить ключевые моменты.

Последующие запросы ставятся в очередь. Пользователи могут менять порядок задач, перемещать одну из них вперед или останавливать задачи, которые ожидают выполнения или выполняются. Прерывание разговора не отменяет задачи, связанные с инструментами, которые должны быть остановлены отдельно, а закрытие аудио- и видеосеанса не останавливает работу, уже переданную Core Agent. Результаты возвращаются в исходный разговор.

WorkSwarm в настоящее время поддерживает два протокола моделей: Qwen Omni real-time WebSocket, используя официальный конечный узел или локальное развертывание, и JoyAI, который объединяет отдельные модели распознавания речи, языковые модели и модели синтеза речи через официальные API или другие платформы. Полнодуплексные мультимодальные модели также могут быть развернуты на Ascend NPU через платформу Huawei Cloud ModelArts с использованием фреймворка вывода vLLM-Omni. WorkSwarm предлагает установщики для Windows, Mac и HarmonyOS, а также пакеты pip, а его репозиторий на GitHub лицензирован под Apache-2.0. Последний отмеченный релиз проекта, v0.2.7 от 30 сентября, добавил Proactive Context Service и межсетевые сессии.

СМОТРИТЕ ТАКЖЕ: Huawei Cloud запускает AgentArts для корпоративного ИИ · Huawei открывает исходный код для обучения openPangu-2.0 на Ascend · Huawei открывает исходный код AscendNPU IR

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: