Исследовательская группа в области ИИ MirroS выпустила AgentGarten — фреймворк, который предоставляет ИИ-агентам мир для действий, наблюдения и обучения. QbitAI сообщил 9 октября, что код, технический отчет и страница проекта общедоступны.
AgentGarten разделяет задачу симуляции мира на две части. Код отвечает за физику, раскладку, контакты и правила игры, поэтому состояние является явным, и каждый результат определяется программой. Нейронный рендерер затем преобразует легкий геометрический эскиз, экспортируемый кодом, такой как глубина или нормали поверхности с камеры агента, в реалистичный следующий кадр. Команда утверждает, что это позволяет избежать двух распространенных компромиссов: сцены игровых движков, которые требуют дорогостоящей художественной работы для реалистичного вида, и видеомодели мира, физика которых скрыта внутри сети и не может быть запрошена или отредактирована.
Рендерер генерирует видео короткими потоковыми фрагментами, чтобы агент мог действовать, видеть результат и принимать решения снова. MirroS обучил его методом, который называется Adversarial Forcing (Принудительное состязательное обучение), который добавляет точное воспроизведение, чтобы градиенты достигали сгенерированной истории модели, и дискриминатор, обученный на реальном видео, для предотвращения дрейфа и артефактов в виде сетки при длительных прогонах. Специальные ядра Triton, графы CUDA и легкий декодер позволяют поддерживать скорость выше 30 кадров в секунду при разрешении 480p на одном GPU.
Чтобы протестировать обучение, команда вернулась к игре в прятки из известного исследования 2019 года, в котором обучение с подкреплением требовало около 25 миллионов эпизодов, прежде чем прячущиеся строили укрытия, и около 100 миллионов, прежде чем ищущие использовали рампы. В AgentGarten агенты видели только отрисованные кадры от первого лица и действовали через короткие программы на Python. После каждого раунда они анализировали свои игры и записывали уроки в сборник правил, который передавался в следующий раунд. Прячущиеся построили укрытия к четвертому раунду, а ищущие перелезали через стены с помощью рампы к десятому раунду.
Тот же цикл был запущен без изменений в четырех других мирах по четыре раунда каждый. Показатель компаньона-собаки вырос с 13 до 19, две машины, пересекающие однополосный мост, сократили общее время с 71 до 41 секунды, две пастушьи собаки загнали в загон три овцы из четырех, а погрузчик на карьере закончил свою работу на 31 секунду раньше.
MirroS представляет эту работу как шаг к созданию агентов, которые продолжают совершенствоваться в физических условиях. Это исследовательская среда, а не готовый продукт для роботов.
СМОТРИТЕ ТАКЖЕ:AIsphere запускает PixVerse R2, модель реального времени, которая запоминает события сессии · ACE Robotics и NTU представляют Puffin-World — мультимодальную модель мира с открытым исходным кодом
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




