Компания AgiBot представила GE-Act 2.0 — собственную модель действий в мире, обученную полностью со случайной инициализацией на данных о манипуляциях в реальных условиях, а не адаптированную из существующего генератора видео. Компания заявляет, что этот выпуск является первым систематическим тестом того, может ли модель действий в мире разблокировать новые навыки реальных роботов при увеличении часов обучения на два порядка, с примерно 300 до 30 000 часов, без специфической для задач донастройки или демонстрационных клипов во время оценки.
В отличие от конвейеров, которые добавляют модуль действий к замороженной модели видео, GE-Act 2.0 совместно обучает представление визуальных данных, прогнозирование будущего и прогнозирование действий на данных роботов. Во время тестирования сцены, фоны, освещение и экземпляры объектов исключаются из обучения. В этом протоколе нулевого выстрела, охватывающем 100 атомарных задач и примерно 20 семейств навыков на двух типах воплощений, успех возрастал с увеличением масштаба данных: на платформе G1-OP общий успех вырос с 17,1% до 44,1%, а на G2-90D — с 13,4% до 31,1%, при этом прирост оставался заметным между уровнями 5000 и 30 000 часов.
Компания выделяет паттерн «зажигания» для тонких навыков. Задачи, показавшие ненулевой успех, расширились с 39 до 76 на G1-OP и с 24 до 72 на G2-90D. Поведение, такое как складывание полотенец, складывание бумажных стаканчиков друг в друга, снятие и надевание колпачков ручек, а также составление цветочных композиций в новых сценах, надежно появлялось только после достижения максимального уровня данных. Также наблюдалась передача навыков между воплощениями: G1-OP предоставил более половины обучающих данных, в то время как G2-90D составил менее 2%, однако более редкое тело все же получило около 17,7 процентных пункта по мере роста общих данных.
Архитектурно визуальный энкодер CoAE сжимает каждый кадр размером 256 на 384 пикселя в 24 токена, сохраняя семантические, динамические и локальные структурные сигналы. Одношаговый визуальный планировщик прогнозирует полный будущий фрагмент, а модель обратной динамики преобразует прогнозируемое изменение в действия, при этом AgiBot указывает примерно 104 миллисекунды на фрагмент действия на RTX 5090. Knowledge-Aligned Selective Optimization выбирает несколько будущих сценариев и сохраняет тот, который наиболее соответствует записанным действиям, чтобы уменьшить несоответствие между планированием и действиями.
Рецепт данных смешивает неполные потоки: часы инструкций и видео для предварительного обучения мировой модели (включая эгоцентричные кадры без меток действий), часы траекторий для обратной динамики, которые включают сбои и прогоны, а также полностью сопоставленные часы инструкций, видео и действий для совместного обучения. В стеке GE от AgiBot GE-Sim нацелен на оценку политики и построение среды, в то время как GE-Act преобразует прогнозируемые будущие сценарии в движение робота. После необязательной донастройки AgiBot сообщает о 60,52% на тестах RoboTwin вне распределения и 0,770 на GenieSim при следовании инструкциям, опережая несколько сравниваемых базовых моделей. Материалы проекта размещены на ge-act-v2.github.io.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




