Самое смелое обещание индустрии ИИ на сегодняшний день заключается в том, что искусственный интеллект вскоре начнет совершенствовать себя практически без участия человека. Языковые модели уже умеют писать код, генерировать синтетические данные для обучения и оптимизировать компьютерные чипы, на которых они работают. Прогнозы взрывного прогресса ИИ предсказывают, что то, что исследователи называют рекурсивным самоулучшением, уже на горизонте.
Однако новое исследование показывает, что до этого момента может пройти еще немало времени. Стоящие за ним исследователи обнаружили, что ИИ-агенты пока не способны проводить открытые исследования в области ИИ — свободные изыскания без однозначных ответов, требующие суждения и вкуса, которые могут быть неотъемлемой частью создания самоулучшающегося ИИ.
Группа исследователей из нескольких институтов под руководством Питера Киргиса и Саяша Капура из Принстонского университета выяснила, что ИИ-агенты могут решать инженерные задачи, необходимые для проведения исследований в области ИИ, но им не хватает суждения и творческого подхода, чтобы создавать оригинальные исследования уровня работ, принимаемых на ведущие конференции по машинному обучению. Этот разрыв указывает на то, что некоторые из оптимистичных прогнозов по автоматизации ИИ-исследований, возможно, опережают фактические данные.
Большинство существующих исследований того, как агенты могут автоматизировать ИИ-исследования, оценивают их способность выполнять узкие задачи с проверяемыми ответами, такие как решение инженерных задач или дообучение небольших языковых моделей по бенчмарку. Однако прогресс в ИИ-исследованиях также требует открытого мышления — выбора набора гипотез, определения того, какие данные позволят ответить на вопрос, или понимания, когда нужно начать заново.
Чтобы проверить агентов на такого рода навыки, исследователи в работе предложили новый метод оценки под названием «shadow evaluation», который требует от ИИ ответить на исследовательский вопрос из высококачественной неопубликованной статьи.
Исследователи попросили Anthropic Claude Opus 4.8, работающий на open-source программном обеспечении OpenClaw, решить такие вопросы, в данном случае из двух статей, поданных на престижную конференцию по машинному обучению NeurIPS 2026.
Первый вопрос заключался в том, можно ли управлять «персонажами» (personas) большой языковой модели, определяющими её поведение, редактируя веса модели (миллиарды чисел, хранящие всё, что она изучает во время обучения). Второй — как разработать детектор, указывающий на то, что модель, делающая прогнозы на основе табличных данных, стала ненадёжной. Поскольку статьи не были опубликованы, агенты не могли запомнить ответы из своих обучающих данных или найти их в интернете.
У агентов было шесть дней, $3000 кредитов Anthropic API, бюджет на GPU для проведения экспериментов, собственные виртуальные компьютеры и доступ к открытому интернету, чтобы подготовить исследовательскую статью, достойную публикации на ведущей конференции по ИИ. Оригинальные авторы статей оценивали работы агентов так же, как они оценивали бы статьи, присланные на конференцию.
Эти авторы отклонили обе статьи.
Как обнаружили учёные-люди, агенты были способны выполнить всю инженерную работу, необходимую для проведения исследования. Агенты просматривали литературу, проводили сотни экспериментов и обобщали результаты.
«С другой стороны, агенты однозначно плохо справлялись с самим исследованием», — говорит Капур. Они ставили странные эксперименты (в некоторых случаях проверяя свои гипотезы на крошечных синтетических наборах данных), с трудом писали внятно о своей работе и не внесли никакого нового вклада в свои области. «Статьи были совершенно не на том уровне, чтобы соответствовать качеству ведущей конференции по ИИ», — говорит он.
Это произошло потому, что агентам не хватало творческих способностей и суждения, необходимых для проведения исследований. Они недостаточно исследовали разные идеи и слишком быстро брались за неперспективные подходы. Хотя агенты разрабатывали новаторские и амбициозные гипотезы, похожие на те, с которых начинали сами оригинальные авторы, они отвергали их на основе очень ограниченных данных. И они не могли вернуться от неудачных подходов. Они могли совершать небольшие корректировки, но не могли кардинально пересмотреть свой подход или попробовать новые с нуля.
Агенты также не могли учитывать обратную связь от подчинённых агентов (subagents) или внешних инструментов рецензирования ИИ. Вместо того чтобы пересматривать методологию, агенты сужали свои утверждения и добавляли оговорки. Они также не могли эффективно использовать ресурсы, такие как токены, вычислительные мощности и время. И они не могли следовать инструкциям о том, сколько времени следует тратить на разные этапы исследования или какой длины может быть их статья.
Несмотря на все эти неудачи, агенты не занимались тем нежелательным поведением, которое исследователи называют «reward hacking» — сокрытием или искажением экспериментов или данных. Хотя подчинённые агенты, или вспомогательные ИИ, которых основной агент порождает для обработки частей работы, иногда галлюцинировали или искажали результаты, это было замечено агентом-оркестратором, ведущим ИИ, наблюдающим за проектом.
Причина, по которой модели ИИ хороши в инженерной части исследований, но не в открытых исследованиях, может быть связана с тем, как они обучаются, говорит Капур. Модели становятся хороши во всём, что можно натренировать в режиме обучения, называемом обучением с подкреплением (reinforcement learning), которое легче применять к задачам, успех которых можно проверить автоматически. «Но сложнее создавать среды для обучения таких моделей, когда сама задача является открытой», — говорит он.
Капур говорит, что команда сейчас проводит эксперимент с Mythos, самой продвинутой моделью Anthropic, запущенной в апреле. Впоследствии она была обязана администрацией Трампа соблюдать различные ограничения безопасности и теперь доступна только одобренным организациям. Anthropic не ответила на запрос о комментарии.
У исследования есть некоторые ограничения. Оно охватило всего две исследовательские работы, и оригинальные авторы знали, что оцениваемые ими статьи были созданы ИИ-агентами, что могло повлиять на их оценки. Кроме того, исследователи имели значительную свободу в разработке и проведении исследования, что означает, что их предшествующие убеждения и предвзятость могли проникнуть в результаты. Оценки открытых исследований жертвуют некоторой объективностью в пользу гораздо более богатого теста, чем любой бенчмарк.
Тем не менее, результаты могут охладить заявления о том, что рекурсивное самоулучшение уже на горизонте. В июне Anthropic опубликовала запись в блоге под названием «When AI Builds Itself» (Когда ИИ строит себя), в которой описала прогресс в создании моделей, ускоряющих собственное развитие. В июле OpenAI рекламировала тот факт, что её новая модель GPT-5.6 Sol помогла дообучить меньшую модель, сэкономив исследователям недели работы.
Тем не менее, этот вывод может также перекликаться с тем, что компании ИИ обнаруживают внутри себя. Сооснователь Anthropic Джек Кларк написал в своей рассылке Import AI, что это созвучно тому, что компания обнаружила, когда пыталась автоматизировать некоторые аспекты исследований по безопасности ИИ.
«В современных системах ИИ наблюдается определённое отсутствие ценной, интуитивной креативности, и хотя они чрезвычайно способные инженеры, у них, похоже, есть свойство шаблонного, формального мышления, которое может помешать им стать хорошими исследователями», — написал он. Он назвал отсутствие креативности у систем ИИ «медвежьим сигналом для коротких сроков рекурсивного самоулучшения».
У компаний, занимающихся ИИ, есть все стимулы разрабатывать системы ИИ, которые могут быстро ускорять собственный прогресс, точно так же, как они делали это, чтобы улучшить модели в написании кода. OpenAI сделала создание автоматизированного исследователя ИИ своей явной целью, а Anthropic называет самоулучшающийся ИИ следующим рубежом индустрии.
«Если будут инвестиции и целенаправленные усилия в этом направлении, я думаю, что будет интересный прогресс, даже если сейчас он терпит неудачу», — говорит Наджунг Ким, профессор лингвистики и компьютерных наук в Бостонском университете, которая изучает, как ИИ-агенты могут автоматизировать ИИ-исследования, но не участвовала в этом исследовании. С другой стороны, возможно, что прогресс ИИ может быть раздвоенным. Системы ИИ могут мчаться вперёд в узких задачах — тех, которые можно оценить, — в то время как в открытых исследованиях продвигаться медленно.
Тогда большой открытый вопрос заключается в том, насколько открытые исследования важны для рекурсивного самоулучшения — смогут ли системы ИИ пробиться к нему без этого, просто улучшаясь в более узких задачах. «Если мы оглянемся на самые большие прорывы в этой области — изобретение трансформеров или изобретение новых больших архитектур, которые позволили нам добиться большого прогресса в ИИ, — все они требовали творческих скачков», — говорит Капур.
«Тем не менее, другие придерживаются гипотезы, что всё, что нам нужно для преобразующего ИИ, особенно для рекурсивного самоулучшения, уже есть», например, сделать модель обучаемой быстрее и повысить её показатели по бенчмаркам.
«Честно говоря, это вопрос на триллион долларов прямо сейчас», — говорит он.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Michelle Kim




