ACE Robotics и NTU представили «open-source» мультимодальную модель мира Puffin-World

робототехника ии компьютерное зрение 3d-моделирование машинное обучение открытый исходный код pandaily.com

Откройте Puffin-World от ACE Robotics и NTU S-Lab: унифицируйте физику, геометрию и внешний вид мира на данных Puffin-16M. Добейтесь ошибок абсолютного положения камеры менее одного градуса на четырех бенчмарках.

ACE Robotics и S-Lab Наньянского технологического университета совместно с Пекинским транспортным университетом и Мичиганским университетом открыли Puffin-World — унифицированную мультимодальную модель мира, которая рассматривает физику, геометрию и внешний вид как нативные трехмерные состояния мира. Релиз включает код, модели и набор данных Puffin-16M, ориентированный на робототехническое восприятие и симуляцию, а не только на предсказание следующего кадра на основе RGB.

Большинство генеративных моделей мира прогнозируют будущие пиксели. Puffin-World вместо этого совместно моделирует физическое состояние с учетом гравитации и широты, геометрическое состояние, восстанавливаемое по глубине, и состояние внешнего вида, отображаемое как RGB. Все это объединено представлением Omni-Camera, которое совмещает абсолютные и относительные системы координат камеры. Абсолютные ориентиры привязывают наблюдения к реальной гравитации и ориентации; относительная геометрия лучей поддерживает непрерывные изменения точки обзора и составные движения. По одному изображению модель оценивает абсолютный крен, тангаж и вертикальное поле зрения; по тексту или изображениям она может синтезировать траектории с произвольной точкой обзора, реконструировать плотную геометрию и выполнять замкнутое исследование, которое корректирует дрейф гравитации и положения при движении камеры по сгенерированной сцене.

Масштаб обучения обеспечивается Puffin-16M: около 15 миллионов триплетов «зрение-язык-камера» в Puffin-Cam-15M и 1 миллион сложных траекторий в Puffin-Traj-1M, охватывающих тангаж, рыскание, крен и составные движения в помещении, на улице, в синтетических сценах и при вождении. Команда также использовала Puffin-World для добавления меток абсолютного положения камеры к 28 общедоступным наборам данных, охватывающим примерно 44,5 миллиона изображений, выпущенных для дальнейших исследований — этот вклад данных призван заполнить пробел в абсолютном положении, оставленный корпусами данных с относительным положением, которые не могут обучить выравниванию по гравитации.

На четырех общедоступных бенчмарках «камера-мир» — Stanford2D3D, MegaDepth, TartanAir и LaMAR — Puffin-World демонстрирует передовые результаты по медианным ошибкам. На Stanford2D3D медианные ошибки крена, тангажа и вертикального поля зрения снижаются до 0,29°, 0,53° и 1,62° соответственно, при этом ошибка крена менее одного градуса также лидирует на MegaDepth (0,28°), TartanAir (0,31°) и LaMAR (0,26°). Материалы проекта также отмечают лидирующие показатели PSNR и LPIPS при моделировании многовидовых сцен RealEstate10K и низкие угловые ошибки на стендах управления камерой с произвольной точкой обзора.

Архитектура объединяет энкодер зрения, выровненный по геометрии, языковую модель, диффузионный генератор и легкий коннектор, чтобы понимание, генерация и реконструкция использовали единую основу без внешних модулей геометрии, специфичных для задач. Для встраиваемых систем открытый код предлагает единую контрольную точку, которая может воспринимать абсолютную физику камеры, моделировать управляемые точки обзора и восстанавливать согласованные 3D-миры — шаг от предсказания кадров к моделированию того, как существует физическая сцена и как ее можно исследовать.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: