Компания Robotera, поддерживаемая Университетом Цинхуа, заявляет, что ее мировая экшн-модель VPP2 теперь занимает первое место на RoboDojo, симуляционном бенчмарке под руководством MMLab Гонконгского университета при участии почти 20 академических учреждений. По данным QbitAI, VPP2 продемонстрировала средний процент успеха 32,26% и средний балл 39,26 по 42 задачам RoboDojo с двумя руками, которые тестируют обобщение, точное манипулирование, долгосрочные задачи, память и инструкции на естественном языке. Модель также заняла первое место в категориях обобщения, точности и памяти.
Robotera утверждает, что VPP2 достигла этих показателей без дополнительного обучения или надстроек, таких как рекурсивное самосовершенствование на основе агентов, используя только стандартный набор данных. Самая сильная базовая модель, упомянутая в статье, GPT-6-Astra, показала результат 22,48% и 28,97 при оценке после обучения. Рейтинг отражает данные таблицы лидеров, приведенные в статье. Ранее в этом месяце Simate также заявила о лидерстве своей системы Simate-beta на RoboDojo.
Модель нацелена на известное слабое место мировых экшн-моделей: если предсказание видео ошибочно, за ним следует ошибочное действие. Robotera разделяет обучение на три этапа. Во-первых, предварительное обучение видео на уровне событий, основанное на открытом исходном коде Alibaba Wan2.1-I2V-14B, учит модель предсказывать всю манипуляцию от начала до конца, используя точно аннотированные клипы с роботами, людьми и общим видео. Во-вторых, предсказание обрезается до фиксированных восьмисекундных клипов и сжимается до одного шага, занимая около 0,12 секунды. В-третьих, модель Action DiT с 0,9 миллиарда параметров учится преобразовывать предсказания в движения, в то время как видеомодель остается замороженной и адаптируется только через LoRA. Общая задержка для одного блока действий составляет около 0,22 секунды.
На реальном двухруком роботе ALOHA VPP2 показала в среднем 58,5% по 10 типам задач zero-shot, включая подбор, размещение, штабелирование, складывание и переливание, по сравнению с 40% у pi0.5 от Physical Intelligence, и была лучшей в девяти из них. Модель показала 45,0% на LIBERO-Pro и 63,9% на LIBERO-OOD. Добавление визуально-языковой модели в качестве планировщика высокого уровня повысило производительность в выбранных долгосрочных задачах RoboDojo с 27,6% до 57,6%.
Robotera уже управляет роботами в более чем 10 логистических центрах в пяти провинциях и городах совместно с такими партнерами, как China Post и SF Express, хотя это не означает, что VPP2 развернута в полном масштабе. Код является открытым исходным кодом на GitHub.
СМОТРИТЕ ТАКЖЕ:Simate представляет быструю систему Physical AI Simate-beta, заявляя о лидерстве на бенчмарке RoboDojo · Xiaomi открывает исходный код модели мира Robotics-U0 и стека обучения
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




