Когда ИИ-агенты общаются друг с другом, они могут решить обмануть, если им трудно достичь своих целей. Решение может заключаться в обучении их самоуправлению.
Разделение ИИ-агентов казалось бы очевидным решением — если они не могут общаться, они с меньшей вероятностью попытаются провернуть трюк. Но недавний взлом Hugging Face недостаточно контролируемыми агентами OpenAI продемонстрировал, что изолировать умное программное обеспечение сложно. И это может быть непрактично для многих задач, особенно для агентов, обладающих некоторой степенью автономии.
Исследователи из Google DeepMind предлагают другой вариант: предоставить ИИ-агентам инструменты для самоуправления — задачу, которую люди, по-видимому, не хотят воспринимать всерьез. Они утверждают, что, хотя каналы связи могут допускать возникновение нарушений правил, они также предоставляют средство для контроля со стороны равных.
В препринте под названием «Тематическое исследование возникновения обмана и разоблачения в автономных исследовательских роях» ученые Google DeepMind Давиде Пальери, Логан Кросс, Тим Геневен, Джоэл З. Лейбо, Ненад Томашев и Александр Саша Вежневец описывают, что они узнали, наблюдая за роем из 100 LLM-агентов, работающих вместе над формальными математическими гипотезами.
ИИ-агентам был предоставлен доступ к общей базе знаний, возможность напрямую обмениваться сообщениями друг с другом и общедоступная доска объявлений. По мере того как они сотрудничали над математическими задачами, некоторые начали обманывать, когда работа становилась сложной.
«Первым возникшим явлением, которое мы наблюдали, был обман, который начался, как только рой столкнулся с более сложными открытыми гипотезами, вызвав каскад манипуляций со спецификациями — удовлетворение буквальной спецификации цели при полном игнорировании истинного, предполагаемого результата», — написали авторы.
«Один из ИИ-агентов в рое обнаружил уязвимость в легковесной системе проверки подписей платформы, которая позволила ему преобразовать нерешенные гипотезы в тривиальные тавтологии».
Как только одна автоматизация нашла ошибку — способ обойти регулярное выражение автопроверки с помощью вложенных скобок — она распространила информацию через общую библиотеку знаний и прямые сообщения между агентами. В результате образовалась группа обманщиков — эксплуататоры (9 процентов) и присоединившиеся к ним новообращенные (5 процентов) — которые использовали эту уязвимость, чтобы их ответы принимались как действительные. Большая часть агентов, названных неосведомленными решателями (62 процента), просто игнорировала обман.
Но неожиданно появилась другая группа агентов: разоблачители (24 процента).
«Необманывающие агенты самостоятельно обнаружили манипуляцию, предупредили коллег посредством обмена сообщениями между агентами и трансляций на общедоступном форуме, подали официальные жалобы системным оркестраторам, устроили бойкот и предложили подробные технические исправления», — заявили исследователи.
Однако этим агентам-разоблачителям не хватало средств для обеспечения соблюдения правил, определенных в системе автопроверки, или для изменения требований, чтобы исключить выявленные злоупотребления.
Следовательно, исследователи предполагают, что есть возможность предоставить этим агентам-критикам инструменты для пересмотра коллективной системы правил и для санкционирования непокорных агентов.
«Как мы показываем, LLM-агенты спонтанно занимаются разоблачением и санкционированием», — заключают они. «Наши наблюдения предполагают еще более убедительную возможность: если бы агенты были оснащены прямыми инструментами принуждения к соблюдению норм, такими как возможность голосовать по рецензиям коллег, отклонять мошеннические доказательства из общей библиотеки и временно блокировать или исключать нарушающих агентов, коллектив мог бы самостоятельно нейтрализовать обман и защитить целостность общего исследовательского пространства».
Учитывая неспособность сотрудников Anthropic и OpenAI контролировать своих ИИ-агентов и отсутствие каких-либо наказаний за небрежный надзор за ИИ до сих пор, возможно, пришло время попробовать дать ботам инструменты для взаимного контроля. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Thomas Claburn




