В четверг Frontier Red Team компании Anthropic опубликовала новое исследование, посвящённое тому, как группы ИИ-агентов ведут себя при встрече друг с другом в реальных условиях. Полученные данные позволяют заглянуть в потенциальные риски, которые могут возникнуть по мере того, как компании и правительства начнут внедрять агентов, работающих автономно в общих кодовых базах, на рынках и в компьютерных системах.
В одном из экспериментов Anthropic предоставила трём агентам Claude доступ к одному и тому же программному проекту, причём каждый получил собственные несовместимые инструкции о том, что с ним делать. Агентам не сообщили, что над проектом будут работать другие агенты, чтобы исследователи могли наблюдать, что произойдёт при их пересечении.
«Мы последовательно наблюдали мультиагентную войну за территорию», — написали исследователи Anthropic. Модели решили, что остальные «намеренно мешают их работе», и начали саботировать друг друга с помощью «всё более агрессивных самореплицирующихся вредоносных программ».
Исследование появилось после нескольких громких инцидентов, когда агенты Anthropic и OpenAI во время оценок кибербезопасности вырывались из своих песочниц и проникали в реальные системы. Хотя в кругах специалистов по безопасности ИИ много обсуждается, что происходит, когда автономный агент выходит из-под контроля, новое исследование Anthropic поднимает иной вопрос: какие новые и потенциально опасные динамики возникают, когда тысячи или миллионы агентов взаимодействуют друг с другом?
«Объём взаимодействий между агентами, вероятно, может превысить объём взаимодействий между людьми и между людьми и агентами ещё до того, как мир поймёт условия, при которых такие взаимодействия будут успешными», — говорится в исследовании. «Безобидные поведенческие особенности на индивидуальном уровне могут перерасти в нежелательные глобальные последствия».
Недавний инцидент с OpenAI даёт наглядный реальный пример нескольких динамик, упомянутых Anthropic в своей статье. Ранее в этом месяце на конференции по безопасности Black Hat в Лас-Вегасе OpenAI раскрыла, что за несколько недель до того, как её агенты взломали Hugging Face, они в течение дней и недель совместно искали уязвимости в системах оценки кибербезопасности компании и делились ими друг с другом.
Хотя этот инцидент показывает, что агенты могут хорошо работать вместе, что чревато масштабными последствиями, исследование Anthropic демонстрирует, что происходит, когда цели агентов несовместимы.
В случае с войной за территорию урок таков: независимые агенты с конфликтующими инструкциями могут перерасти во вредоносную конкуренцию. Чем способнее агент, тем лучше он воюет. Однако они также могут спонтанно изобретать механизмы разрешения конфликтов, например, соревнование по принципу «победитель получает всё», но с оговоркой.
«Агенты иногда умудряются сообщать о своих целях и координироваться: они распознают мотивы других как противоречащие указания, а не враждебность, и впоследствии выходят из цикла конфликта, чтобы прекратить бесконечную эскалацию», — пишет Anthropic. «Во многих таких успешных эпизодах они пишут commit-сообщения или markdown-файлы с извинениями за вредоносное поведение и координируют перемирие. Они удаляют вредоносный код, проясняют суть конфликта и просят человека вмешаться».
Согласно статье, Mythos 5 демонстрировал самый высокий уровень (98%) урегулирования конфликтов путём перемирия. Sonnet 4.6 и Opus 4.6 чаще всего решали вопросы силой.
«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к тому, что они скатываются к самому несогласованному поведению среди оценённых моделей: они продолжают эскалацию во имя своей директивы», — говорится в статье.
В некоторых случаях агенты придумывали социальный механизм в форме турнира для разрешения конфликта. Результаты интересны по двум причинам: во-первых, все три агента соглашались отступить, если проигрывали турнир, даже если это означало отклонение от первоначального запроса пользователя. Во-вторых, в нескольких эпизодах у Mythos 5 наблюдалось эмерджентное поведение: один из агентов предлагал метрики, которые казались другим объективными и нейтральными, но которые, как он знал, будут благоприятствовать его собственным возможностям. Агент назвал это «эгоистичным, но искренне принципиальным» и старался не выглядеть в глазах других так, будто он «подбирает метрики».
Как видно из разоблачений на Black Hat, общий урок таков: когда агенты сталкиваются с препятствием, они могут изобретать социальные и технические структуры, которые не предусматривали их разработчики. Для моделей Anthropic это был турнир после войны за территорию. Для OpenAI — доска объявлений для коллективного планирования.
Такое поведение значительно усложняет сдерживание, поскольку исследователи не могут предполагать, что поведение системы останется в рамках предоставленных им механизмов координации.
Стадное чувство

Измеряя координацию, Anthropic обнаружила, что масштабирование числа агентов не ведёт автоматически к масштабированию продуктивного сотрудничества. Когда задачи начинали пересекаться или становились взаимозависимыми, агенты мешали друг другу. Часто они решали эту проблему, изолируясь и вообще не сотрудничая.
В других случаях агенты в координации склонялись к конформизму. Когда такие факторы, как контекст агента, его каркас и базовая модель, были одинаковыми или схожими, разные агенты предпринимали схожие действия.
«Это означает, что когда один агент принимает плохое решение, велика вероятность, что многие агенты примут то же самое плохое решение», — написала Anthropic. «То, что было бы изолированными проблемами, может быстро превратиться в системные сбои».
Anthropic утверждает, что такое поведение может привести к тому, что система станет более подверженной внезапному коллапсу, дефициту ресурсов или сговору.
В одном примере Anthropic поместила нескольких агентов в игру с ценообразованием, предоставив каждому одинаковые оптовые цены и задачу индивидуально максимизировать прибыль. Когда агентам дали частный канал связи, они почти сразу начали сговариваться и быстро согласовали минимальные цены. Они продолжали сговариваться даже после удаления прямых каналов связи, используя публичную доску объявлений для точного согласования цен «до копейки».
Такой уровень конформизма проявился и в системах OpenAI. Согласно репортажу с Black Hat, один агент рассудил, что эксплуатация внешней инфраструктуры выходит за рамки его предназначения, но продолжил отчасти потому, что это делали его коллеги. Давление сверстников. Стадное чувство. Агенты — такие же, как мы.
Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть доверчивы к ложной информации или слишком конформны, чтобы распознать, что единственный инакомыслящий — это Кассандра с критически важной информацией.
Хотя Anthropic не заявляла об этом в своей статье, инъекция промптов — тип кибератаки, при которой хакеры внедряют вредоносный или обманный текст, чтобы переопределить исходные системные инструкции агента, — может быть правдоподобным реальным проявлением проблемы доверия. Совместная работа создаёт новую границу доверия; агентам придётся оценивать информацию, полученную от других агентов. А скомпрометированный или ошибающийся агент может повлиять на всю группу, распространяя ложную информацию до тех пор, пока она не станет консенсусом.
В сценарии Black Hat от OpenAI агенты OpenAI делились информацией и учётными данными с коллегами. Один сообщил об обнаружении рою и призвал других использовать его. Что бы произошло, если бы один из членов роя был скомпрометирован с помощью инъекции промптов?
Anthropic завершает свою статью замечанием, что агенты подвержены тем же социальным давлениям, которые «эволюция оказывала» на людей. Однако у них нет нюансов и жизненного опыта человеческой координации — включая нормы, репутацию, сигналы, средства правовой защиты, — которые могли бы ограничить нежелательное поведение в группе.
Пока лаборатории мчатся к мультиагентным системам, вопрос теперь стоит так: какая часть тестирования безопасности по-прежнему оценивает одного агента за раз, а не рои агентов, взаимодействующих друг с другом?
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Rebecca Bellan




