Исследователи из Xiaohongshu (RED), влиятельной китайской платформы для обмена информацией о стиле жизни и социального коммерческого взаимодействия, опубликовали Evolving-RL — новую структуру обучения с подкреплением, которая позволяет ИИ-агентам автономно развивать свои навыки на основе опыта, без необходимости в отдельных модулях для извлечения и выполнения навыков.
Существующие ИИ-агенты сталкиваются с фундаментальным ограничением: после обучения параметры модели фиксируются. При столкновении с новыми задачами в процессе эксплуатации они не могут учиться на опыте или совершенствоваться автономно. Существующие подходы к «саморазвивающимся агентам» обычно оптимизируют способы хранения и извлечения опыта, но оставляют без внимания способность самой модели извлекать полезные навыки. Когда низкокачественный опыт загрязняет обучающий сигнал, агенты в конечном итоге учатся игнорировать весь накопленный опыт — это классическая проблема «амнезии навыков».
Evolving-RL разрушает эту тупиковую ситуацию благодаря архитектуре совместной эволюции с использованием единой модели. Одни и те же параметры модели одновременно выполняют две роли: «извлекателя», который дистиллирует структурированные текстовые навыки из прошлых траекторий взаимодействия, и «решателя», который применяет эти навыки к новым задачам. Обе роли используют одну и ту же базовую модель, которая обновляется посредством унифицированного цикла оптимизации.
Процесс обучения разворачивается в четыре этапа. Сначала решатель взаимодействует с исходными задачами для генерации траекторий взаимодействия. Затем извлекатель создает несколько возможных навыков из каждой траектории. Третье, эти навыки тестируются на связанных последующих задачах для оценки их качества. Четвертое, совместный сигнал оптимизации направляет обе роли на одновременное улучшение — производительность в последующих задачах вознаграждает высококачественные навыки, в то время как воздействие разнообразного качества навыков обучает решателя использовать хорошие навыки и противостоять вводящим в заблуждение.
Результаты поразительны. На внутреннем бенчмарке ALFWorld по взаимодействию Evolving-RL достиг 96,0% успешности с использованием навыков на известных задачах и 88,6% на неизвестных задачах — это улучшение на 98,7% по сравнению с GRPO на неизвестных задачах. На бенчмарке веб-навигации Mind2Web Evolving-RL достиг 30,87% точности действий по сравнению с 22,73% у GRPO, с особенно сильным ростом в сценариях, охватывающих несколько задач (42,0% против 28,8%).
Исследования по исключению подтвердили, что и извлекатель, и решатель должны обучаться совместно. Обучение только одного компонента приводило к значительно худшим результатам: обучение только извлекателя приводило к переобучению навыков на данных обучения, в то время как обучение только решателя заставляло модель научиться безразличию ко всем навыкам. Только полная структура совместной эволюции обеспечила оптимальную производительность как в знакомых, так и в новых сценариях.
Навыки, сгенерированные Evolving-RL, также продемонстрировали переносимость между моделями. При внедрении в базовую модель Qwen2.5-7B-Instruct навыки, извлеченные Evolving-RL, повысили ее уровень успеха в ALFWorld с 45,5% до 60,4%. Те же навыки улучшили модель, обученную с помощью GRPO, с 79,9% до 88,8%. Это подтверждает, что фреймворк производит подлинно обобщаемые эмпирические знания, а не артефакты, специфичные для конкретной модели.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




