Xiaomi открыла исходный код Xiaomi-Robotics-U0 — авторегрессивной модели мира для робототехники, которая рассматривает синтез, ориентированный на роботов, как продолжение генерации изображений и видео, а не как узкоспециализированный инструмент для траекторий. Официальные материалы описывают основную модель примерно из 38 миллиардов параметров, непрерывно обучаемую для воплощенного интеллекта, с дополнительными общедоступными весами, включая варианты Xiaomi-Robotics-U0-4B и FlashAR, на Hugging Face и ModelScope, а также код для инференса, демо Gradio и релизы для обучения FSDP, датированные началом сентября.
В рамках фреймворка next-token модель объединяет генерацию изображений по текстовому описанию, редактирование изображений по любому вводу, генерацию сцен с воплощением из нескольких видов, управляемый перенос воплощенных объектов и вывод воплощенного видео. Xiaomi заявляет, что стек сохраняет базовую визуальную семантику, добавляя при этом рассуждения, ориентированные на роботов, посредством одноэтапного и последовательного обучения, включая чередующиеся потоки подзадач-подцелей и воплощенное видео с несколькими FPS (кадрами в секунду) — 1, 3 и 5 кадров в секунду. В архитектурных заметках упоминается токенизация изображений IBQ и мультимодальный словарь, сохраняющий авторегрессивное масштабирование между модальностями, построенный на компонентах Qwen3-32B и EMU3.5.
Эффективность инференса — второй важный аспект. FlashAR+ заменяет последовательное посимвольное визуальное декодирование на антидиагональную параллельную генерацию и работает в паре с пакетной обработкой vLLM; Xiaomi заявляет об ускорении генерации изображений размером 1024×1024 до примерно 82,9–83 раз, сокращая время получения одного образца с примерно 450,8 секунд до 5,44 секунд на заявленном оборудовании. Страницы с описанием возможностей утверждают, что по показателям генерации сцен с несколькими видами и переноса объектов модель превосходит GPT-Image-2 на внутренних наборах данных hard/easy, а также занимает первое место среди более чем 100 моделей на WorldArena с EWMScore_P 73,64 (UNIS (Xiaomi-Robotics-U0)).
На последующих этапах данные для переноса стиля из модели смешиваются с реальными демонстрационными наборами для дообучения политики. Xiaomi сообщает о прогрессе в выполнении задач с помехами, который вырос примерно с 36,9% до 63,2% при наличии посторонних фонов и освещения, с меньшим снижением по сравнению с чистой лабораторной базовой линией. Контрольные точки для генерации видео пока отстают от релизов для изображений и переноса. Командам следует проверить условия лицензии, выбор движка FlashAR и воспроизводимость результатов WorldArena третьими сторонами, прежде чем рассматривать открытые веса как готовое решение для производственных роботов.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




