Самодельная полномодальная большая модель AgiBot WITA-Omni Preview набрала 85,21 балла в комплексном рейтинге DailyOmni, обойдя Alibaba Qwen, Google Gemini, ByteDance Doubao и NVIDIA и заняв первое место с шестью наивысшими показателями среди восьми оценочных критериев. Бенчмарк проверяет способность одновременно обрабатывать аудио- и визуальные сигналы в реальных условиях, включая аудиовизуальное выравнивание на уровне 86,13, временное рассуждение о событиях — 84,64, кросс-модальное комплексное рассуждение — 85,06, а также лидирующие показатели в задачах понимания видео длительностью 30 и 60 секунд. В отличие от универсальных мультимодальных моделей, оптимизированных для взаимодействия с цифровым контентом, WITA-Omni с самого начала разработана для воплощенного взаимодействия, где роботы должны в реальном времени понимать, реагировать и действовать в физической среде.
Архитектурной инновацией стала парадигма Thinker-Talker-Actor, заменяющая традиционный последовательный конвейер. Обычное взаимодействие роботов обрабатывает распознавание речи, семантическое понимание, генерацию ответа, синтез речи и вывод действий как последовательные этапы, каждый из которых добавляет задержку и вызывает накопление задержек. WITA-Omni запускает ядро мультимодального рассуждения Thinker, потоковую генерацию речи Talker и модули действий и выражений Actor параллельно на единой временной шкале. Модуль Actor принимает на вход не только семантическое состояние Thinker, но и аудио-латентные переменные Talker, что позволяет жестам и мимике синхронизироваться с ритмом речи, паузами, акцентами и эмоциональным тоном. Это устраняет разрыв между тем, что говорит робот, и тем, как он двигается.
Архитектура расширяет парадигму Thinker-Talker, ранее разработанную для диалогового ИИ, добавляя модуль Actor в качестве первоклассного выходного канала наряду с речью. Thinker объединяет текстовые, графические, аудио- и видеовходы через специализированные кодировщики и легковесные проекционные слои в единое пространство представлений для кросс-модального рассуждения и принятия решений о взаимодействии. Talker генерирует естественную речь, обусловленную скрытыми состояниями Thinker. Actor управляет головой действий и головой выражений, управляемыми как семантическим состоянием Thinker, так и аудио-характеристиками Talker. Механизм кросс-потоковой синхронизации гарантирует, что жесты робота реагируют на изменения темпа речи, сдвиги выражений соответствуют тону, а физические действия сохраняют временную согласованность с вербальной коммуникацией.
Рейтинг следует за мировой моделью AgiBot Genie Envisioner-Sim 2.0, занявшей первое место на WorldArena ранее. Вместе эти два достижения формируют трехстолповой стек возможностей ИИ: WITA-Omni для взаимодействия, мировая модель для понимания физического мира и аппаратное обеспечение робота для действий в нем. Победа в рейтинге подтверждает, что компании в области воплощенного ИИ могут разрабатывать превосходные общие возможности, оптимизируя их под ограничения реального взаимодействия, а не адаптируя универсальные модели. По мере перехода роботов из контролируемых заводских сред в неструктурированные социальные пространства способность синхронно обрабатывать несколько сенсорных потоков и отвечать скоординированными вербальными и физическими действиями становится ключевым отличием. AgiBot позиционирует полномодальное синхронное взаимодействие как новое конкурентное измерение в индустрии воплощенного ИИ, отдельное от конкуренции за чистоту моделей, доминирующей в сфере универсального ИИ.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




