X-Square Robot представила WALL-WM: первую в мире «Embodied AI» модель для прогнозирования событий уровня «world model»

воплощенный ии модель мира предсказание событий робототехника Dmuon pandaily.com

Компания X-Square Robot выпустила WALL-WM — первую в мире модель мира воплощенного ИИ с предсказанием на уровне событий, которая переходит от покадрового прогнозирования к пониманию семантических событий, позволяя роботам схватывать цели задач, а не запоминать последовательности пикселей. — pandaily.com

Китайская компания X-Square Robot, занимающаяся воплощенным ИИ и создательница серии фундаментальных роботизированных моделей GreatWall, представила WALL-WM — первую в мире модель мира с предсказанием на уровне событий для воплощенного интеллекта. Этот прорыв переносит единицу предсказания моделей мира из фиксированных временных интервалов в семантические события, коренным образом меняя то, как роботы понимают и выполняют физические задачи.

Традиционные модели «зрение-язык-действие» работают, предсказывая фиксированные по длине блоки действий кадр за кадром — прогнозируя, где окажется рука робота через 0,1 секунды, 0,2 секунды и так далее. Такой подход заставляет модель запоминать, «на сколько миллиметров палец перемещается за кадр», вместо того чтобы понимать саму цель: «схватить чашку». Результатом является хрупкая обобщающая способность — измените чашку, измените стол, измените тайминг, и модель даст сбой. WALL-WM заменяет это предсказанием, ориентированным на события. Вместо того чтобы спрашивать, что произойдет в следующие 0,1 секунды, модель напрямую визуализирует целевое состояние — момент захвата — и синхронно генерирует последовательность действий, необходимых для его достижения. Поскольку события по своей сути являются семантическими абстракциями, общими для разных сценариев и объектов, WALL-WM демонстрирует значительно более стабильную обобщающую способность между сценами.

В статье под названием «WALL-WM: Carving World Action Modeling at the Event Joints» (WALL-WM: Выделение моделирования действий мира по суставам событий) описывается фундаментальная архитектурная проблема в воплощенном ИИ: модальности текста, зрения и действия оперируют на разных геометрических многообразиях и временных масштабах. Текст — это высокоуровневое семантическое намерение с низкой энтропией; зрение — непрерывно развивающееся высокоразмерное наблюдение; действие физически ограничено и чувствительно к состояниям контакта, точности синхронизации и незначительным возмущениям. Прямое проецирование всех трех в общее латентное пространство приводит к тому, что предварительно обученные представления отклоняются от своих исходных геометрических априорных знаний.

Решение X-Square Robot использует трехуровневую архитектуру: уровень ввода событийных инструкций, основной уровень предсказания событий с использованием распределенной оптимизации Muon (DMuon) для повышения стабильности сходимости и стратегию многособытийного упаковывания, которая обучает несколько событий в одной длинной последовательности для уменьшения вычислительных потерь. На бенчмарках по генерации воплощенного видео WALL-WM превосходит модели, включая Wan2.1-14B и Open-Sora 2.0, по метрикам качества движения, семантической согласованности и физической правдоподобности. На бенчмарке роботов Core15 L1 он достигает значительно более высоких показателей завершения задач, чем Pi0.5 и DreamZero, в базовых задачах, задачах рассуждения, ловкой манипуляции и сценариях обобщения, что делает его одной из самых производительных L1-моделей в условиях абстрактных инструкций.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: