Институт исследований индустрии искусственного интеллекта (AIR) Университета Цинхуа совместно с Domain Transform представил Zeva — метод воплощенного манипулирования, который сохраняет веса основной модели замороженными и улучшается во время развертывания только за счет причинной памяти в контексте. На нескольких эталонных тестах воплощенного манипулирования совокупный успех вырос примерно с 26% до 73% — повышение на 47 пунктов без обычного цикла сбора данных, разметки и дообучения. В статье под названием «Zeva: причинное обучение в контексте для обобщенного воплощенного манипулирования» используется Cosmos3 в качестве основной модели, а среди авторов указаны Лю Юньсинь и Цао Тин из Tsinghua AIR. Предлагается не более масштабное дообучение модели «зрение-язык-действие», а слой памяти, который учит фиксированную модель тому, как ее собственные действия изменили сцену.
Zeva состоит из трех компонентов. Кодировщик причинно-следственных связей сопоставляет каждое действие с результирующим изменением состояния, формируя исходный материал для последующих запросов. Причинная память затем работает в двух временных масштабах: краткосрочная траектория взаимодействия для текущей попытки и более долгосрочная постоянная память взаимодействия, которая накапливает отфильтрованный опыт между попытками. Раздельное хранение этих данных является преднамеренным, чтобы шумный сбой не отравил сразу долговременную память, но при этом подавал информацию для следующего действия в том же эпизоде. Наконец, инъекция политики в контексте вставляет причинные запросы во входные данные замороженной модели без каких-либо обновлений градиента во время развертывания — это означает, что адаптация на месте становится проблемой инжиниринга контекста, а не проблемой эксплуатации обучения.
На RoboCasa365-Atomic5 средний показатель успеха достиг 76,8%. Более наглядные с операционной точки зрения цифры получены в ChemLab-Evo, наборе для химической лаборатории: подъем пробирки вырос с 65% до 100%, установка стакана — с 25% до 70%, а наливание воды — с 30% до 80%. Увеличение было более значительным там, где базовые показатели были ниже, что соответствует идее о том, что частые сбои генерируют более полезные причинно-следственные пары. Одна демонстрация человеком добавила примерно 20 пунктов к показателю установки стакана и около 15 — к наливанию воды. Авторы приписывают это инъекции памяти, а не изменению параметров, что привлекательно при ограниченных бюджетах на разметку данных.
Химия была выбрана потому, что изменения состояния, такие как уровень жидкости и положение сосуда, относительно чисты, поэтому пары кодировщика остаются малошумными; в статье отмечается, что задачи с деформируемыми объектами, подобные стирке, могут быть сложнее. Практически Zeva заменяет недели специфического для объекта дообучения более длинными контекстами и более высокой стоимостью вывода на каждом шаге, которая улучшается с использованием. Объекты, которые редко меняются, могут по-прежнему предпочитать классическое дообучение из соображений стоимости. Независимые роботизированные платформы, помимо представленной конфигурации Cosmos3, не входили в состав раскрытого пакета, поэтому заявления о переносимости остаются теоретическими до тех пор, пока больше лабораторий не воспроизведут стек памяти на другом оборудовании и таксономиях задач.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




