Anthropic предупреждает: Claude AI развивается быстрее, чем ожидалось, и призывает к созданию механизма для остановки «frontier development»

Anthropic ии Claude самоулучшение код отчет tomshardware.com

Anthropic опубликовала доклад, предупреждающий, что путь развития ИИ может привести к потере контроля со стороны человека. В отчете говорится о риске рекурсивного самоулучшения систем ИИ. — tomshardware.com

Компания Anthropic опубликовала доклад, в котором предупреждает, что текущий путь развития может в конечном итоге привести к тому, что люди потеряют способность контролировать системы ИИ. Это произошло на фоне раскрытия информации о том, что Claude теперь пишет более 80% кода, вносимого в собственную кодовую базу компании. Исследовательское подразделение компании, Институт Anthropic, заявило, что ИИ уже начал ускорять собственное развитие, и эта тенденция может привести к рекурсивному самоулучшению — моменту, когда модель самостоятельно проектирует и создает своего преемника с минимальным участием человека. В докладе утверждается, что мир должен сохранить возможность замедлить или приостановить развитие передовых систем, и содержится предостережение о том, что периодические расхождения в поведении, наблюдаемые в современных моделях, могут стать более частыми и трудными для понимания по мере того, как эти модели будут создавать следующее поколение. Компания описала три довольно мрачных сценария развития событий на ближайшие годы, зарезервировав самые серьезные предупреждения для сценария, при котором модели смогут полностью совершенствовать себя сами. В этом случае, по мнению Anthropic, темп прогресса будет определяться почти исключительно доступными вычислительными мощностями, а люди будут оттеснены к ролям надзора и верификации, при этом самоулучшающаяся модель будет доминировать, поскольку ее возможности превзойдут возможности людей, которые ее создали. Фирма назвала эту потенциальную проблему согласования (alignment) и задачу удержания поведения системы в соответствии с намерениями человека частью будущего, в котором она наименее уверена. Расхождения, редкие и терпимые сегодня, могут накапливаться из поколения в поколение, пока контроль не будет утерян, говорится в докладе, хотя компания допустила, что достаточно способная и хорошо согласованная модель может вместо этого выбрать прекращение собственного развития. Anthropic пишет, что это рассогласование может «становиться все более частым, но менее понятным, пока мы не потеряем над ними контроль». Anthropic подкрепляет эти предупреждения рядом внутренних показателей, которые ранее не публиковались. Более 80% кода, внесенного в производственную кодовую базу по состоянию на прошлый месяц, было создано Claude, что значительно выше, чем в начале года, когда этот показатель составлял менее нескольких процентов до того, как Claude Code стал доступен в предварительном просмотре для исследований в феврале прошлого года. Anthropic заявляет, что средний инженер теперь «вносит в квартал в 8 раз больше кода, чем в период с 2021 по 2025 год». По самым сложным и наименее специфицированным задачам кодирования Anthropic сообщила, что Claude добился успеха в 76% случаев в мае 2026 года, что на 50 процентных пунктов больше за шесть месяцев. В рамках повторяющегося внутреннего теста, который требует от каждой новой модели ускорить выполнение обучающего кода, результаты выросли примерно с утроения исходной скорости с Claude Opus 4 в мае 2025 года до примерно 52 раз с невыпущенной моделью Mythos Preview в апреле. Anthropic заявила, что замедлит или приостановит разработку, только если конкурирующие лаборатории, находящиеся на переднем крае или близко к нему, сделают то же самое верифицируемым образом, и что остановка работы одной компанией изменит лидера, но не приведет к более широким результатам. Очевидно, этого не произойдет. Все приведенные Anthropic цифры являются самостоятельно заявленными и не прошли аудит, и они появились через несколько дней после того, как компания подала заявку на проведение IPO. Компания представила аналогичную самооценку в апреле, когда заявила, что Mythos Preview обнаружила тысячи серьезных уязвимостей в программном обеспечении, что вызвало сомнения в том, насколько это утверждение основывалось на небольшой ручной выборке.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: