Исследователь Anthropic приоткрыл завесу над самосовершенствующимся ИИ

Anthropic ии согласование автоматизация исследования производительность techcrunch.com

Anthropic представила автоматизированных исследователей, которые за 6 часов превосходят людей в улучшении согласования ИИ. Система AAR исправила все 10 тестов на несогласованное поведение без потери производительности, затрачивая $4 в час против $150 у людей. Узнайте, как рекурсивное самосовершенствование меняет будущее ИИ.

В пятницу компания Anthropic опубликовала новую статью под названием «Автоматизированные исследователи могут надежно устранять сбои согласования», в которой подробно описывается, как системы ИИ могут надежно улучшать производительность модели на наборе эталонных тестов согласования. При наличии 10 эталонных тестов для конкретных несогласованных поведений автоматизированные системы смогли улучшить производительность по каждому из них без ухудшения общей производительности.

Под руководством сотрудника Anthropic Чэнь Юэ-Ханя система воспроизводит большую часть традиционного подхода к исследованиям. Каждая автоматизированная система ищет в доступной литературе, предлагает метод и обучает модель с использованием этого метода в течение 30 минут, постепенно повышая эталонный показатель в течение нескольких итераций. Эффективные методы сохраняются, а неэффективные отбрасываются, что позволяет системе работать быстро и в больших масштабах.

«В целом эти результаты дают первые свидетельства того, что автоматизированное пост-обучение согласованию может стать практичным в ближайшее время», — говорится в статье.

Статья является шагом к рекурсивному самосовершенствованию, которое многие считают следующим значительным шагом в прогрессе ИИ. Если модели смогут улучшать собственное обучение согласованию, вполне вероятно, что они смогут более широко улучшать практики обучения — после чего исследователи ИИ-люди могут вскоре устареть.

Статья не стесняется обсуждать эту идею, прямо сравнивая Автоматизированного исследователя согласования (AAR) с его человеческим аналогом. «Лучший метод AAR в среднем превосходит то, что предлагают опытные люди, в течение шести часов», — говорится в статье. «Направления исследований под руководством человека не приводят к более высокой производительности».

Есть даже сравнение затрат, на случай, если кто-то еще не убежден. «AAR стоит примерно 4 доллара в час за API-инференс против 150 долларов в час, которые мы платим нашим исследователям-людям».

Справедливости ради, в статье также указывается на несколько ограничений этого подхода. Автоматизированная система работает только в той мере, в какой эталонные тесты отражают фактические цели согласования, и даже в этом случае предстоит значительная работа по установлению и поддержанию этих эталонных тестов — не говоря уже о поддержании и расширении литературы, из которой черпают автоматизированные исследователи.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: