ACL 2026: I2B-LPO от Alibaba DAMO Academy порывает с гомогенизацией RLVR — от «repetitive sampling» к эффективному исследованию

Rlvr I2b-Lpo Acl 2026 обучение с подкреплением модели рассуждений pandaily.com

Фреймворк I2B-LPO от Alibaba DAMO Academy, принятый на ACL 2026 Main, повышает точность математических рассуждений до 5,3% и семантическое разнообразие до 7,4% путем направления моделей на генерацию более разнообразных траекторий рассуждений. — pandaily.com

I2B-LPO — это фреймворк для улучшения исследования в области постобучения RLVR (обучение с подкреплением с верифицируемыми наградами), который направляет модели на генерацию более разнообразных траекторий рассуждений за счет улучшения стратегий прокрутки (rollout), переводя поведение исследования с «повторяющейся выборки» на «генерацию более различимых траекторий рассуждений в ключевых узлах». На нескольких математических бенчмарках он одновременно повышает точность и семантическое разнообразие — до 5,3% и 7,4% соответственно.

Эта работа была принята на ACL 2026 Main командой Intelligent Decision из Академии DAMO компании Alibaba.

В последние годы, с появлением моделей рассуждений, таких как DeepSeek-R1, обучение с подкреплением с верифицируемыми наградами (RLVR) стало важной парадигмой обучения для улучшения математических способностей и навыков кодирования. Его основная идея: выборка нескольких путей рассуждения для одной и той же задачи и, в соответствии с сигналами награды, усиление правильных путей и подавление неправильных.

Интуитивно кажется, что если траекторий прокрутки будет достаточно много, сможет ли модель всегда исследовать больше решений и получить более эффективные сигналы обновления? Однако в реальном обучении слепое увеличение количества выборок не обязательно приносит улучшение.

I2B-LPO решает эту проблему, представляя новую стратегию исследования, которая направляет модель к более различимым рассуждениям в точках принятия решений, а не просто к генерации большего количества однотипных траекторий. В результате модель не только работает лучше, но и мыслит более разнообразно.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: