I2B-LPO — это фреймворк для улучшения исследования в области постобучения RLVR (обучение с подкреплением с верифицируемыми наградами), который направляет модели на генерацию более разнообразных траекторий рассуждений за счет улучшения стратегий прокрутки (rollout), переводя поведение исследования с «повторяющейся выборки» на «генерацию более различимых траекторий рассуждений в ключевых узлах». На нескольких математических бенчмарках он одновременно повышает точность и семантическое разнообразие — до 5,3% и 7,4% соответственно.
Эта работа была принята на ACL 2026 Main командой Intelligent Decision из Академии DAMO компании Alibaba.
В последние годы, с появлением моделей рассуждений, таких как DeepSeek-R1, обучение с подкреплением с верифицируемыми наградами (RLVR) стало важной парадигмой обучения для улучшения математических способностей и навыков кодирования. Его основная идея: выборка нескольких путей рассуждения для одной и той же задачи и, в соответствии с сигналами награды, усиление правильных путей и подавление неправильных.
Интуитивно кажется, что если траекторий прокрутки будет достаточно много, сможет ли модель всегда исследовать больше решений и получить более эффективные сигналы обновления? Однако в реальном обучении слепое увеличение количества выборок не обязательно приносит улучшение.
I2B-LPO решает эту проблему, представляя новую стратегию исследования, которая направляет модель к более различимым рассуждениям в точках принятия решений, а не просто к генерации большего количества однотипных траекторий. В результате модель не только работает лучше, но и мыслит более разнообразно.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




