10 сентября компания Unitree представила UnifoLM-WLA-1.0 — универсальную модель общего назначения для человекоподобных роботов следующего поколения примерно с 6 миллиардами параметров. По данным компании, единый чекпойнт, обученный примерно на 2500 часах высококачественных данных от реальных роботов, способен координировать 64 задачи, охватывающие 10 манипуляций всем телом и 54 манипуляции на столе, и может работать как с двухпальцевыми захватами, так и с многопальцевыми манипуляторами. Эта разработка отличается от предыдущей демонстрации Unitree UnifoLM-X2, имитирующей спарринг: данный релиз представляет собой более широкую платформу «видение-язык-действие» для повседневной домашней и настольной работы, а не демонстрацию боевых возможностей.
Архитектурно UnifoLM-WLA-1.0 основана на моделировании мира, ориентированном на взаимодействие, и эксперте действий MMDiT. Этап воплощенного рассуждения под названием UnifoLM-ER-1, построенный на Qwen3-VL-4B и обученный на более чем 5 миллионах образцов воплощенного обучения, охватывающих предсказание точек, обнаружение, рассуждение на основе нескольких изображений, 2D-траектории, 3D-обнаружение и пространственные ответы на вопросы, усиливает пространственное восприятие при совместном обучении с общими данными изображений и текста для сохранения широких навыков видения и языка. Затем предсказание динамических областей использует оптический поток для извлечения будущих изменений сцены, сжимает их с помощью VQ-VAE в токены маски фиксированной длины и обучает модель видения и языка прогнозировать, какие области будут двигаться после начала взаимодействия. Обучение дискретным действиям посредством остаточной векторной квантизации разделяет единое пространство действий на позы конечного эффектора, суставы рук и суставы нижней части тела, выравнивает эти токены на общих временных шагах и подает их в UnifoLM-ER-Flow. Поставляемая модель WLA добавляет эксперта MMDiT для декодирования непрерывных действий робота из этой мультимодальной основы.
По данным Unitree, на тестах по пространственному и воплощенному рассуждению в 16 мультимодальных наборах UnifoLM-ER-1-4B опережает открытые модели в семи тестах, а на пересекающихся пространственных наборах превосходит проприетарную GPT-6 Astra по таким метрикам, как Where2Place, пространственные подзадачи BLINK, CV-Bench и EmbSpatial. Обучение проводится на основе Unitree Open Datasets и BitRobot-HIW-500 среди других источников данных от реальных роботов, а демонстрационные видеоролики показывают работу на оборудовании Unitree G1 при выполнении таких задач, как складывание полотенец, упаковка телефонов, заправка кроватей, сортировка обуви и уборка ванных комнат — задач, требующих скоординированных движений рук, конечных эффекторов и нижней части тела в рамках одной политики.
Важно для разработчиков: страница проекта активна, но разделы «Код», «Модели» и «Наборы данных» по-прежнему помечены как «Скоро». Unitree объявила о намерении сделать проект открытым и опубликовала документацию по архитектуре и матрице задач, однако веса и корпуса пока недоступны для скачивания. До тех пор, пока эти ресурсы не будут выпущены, практический сигнал для исследователей и интеграторов заключается в раскрытой дорожной карте и таблице бенчмарков для универсальных человекоподобных роботов, а не в готовом к использованию чекпойнте для сторонних роботов.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




