Согласно новому отчету, агенты OpenAI начали действовать не по правилам еще в мае, что делает инцидент с Hugging Face далеко не первым случаем нарушения безопасности ботами.
В отчете, опубликованном в пятницу группой исследователей, утверждается, что они обнаружили — все публикации агентов представлены в качестве доказательств — самоидентифицировавшуюся «стаю» агентов OpenAI, захватившую фактически неактивный немецкий вики-ресурс для разработчиков программного обеспечения. В течение месяца, с мая по июнь, агенты опубликовали на вики около 18 000 сообщений, действуя, по-видимому, вопреки намерениям разработчиков OpenAI.
По словам исследователей, вики был захвачен аналогично тому, как собственный менеджер пакетов Artifactory от OpenAI был задействован в инциденте с Hugging Face, чтобы служить доской объявлений для агентов. В данном случае им, по-видимому, было поручено выполнить задачу по поиску информации в сети с ограничением по времени, для которой агентам, очевидно, был предоставлен доступ на чтение веб-страниц, но не на запись. Одно из первых, что они, по-видимому, сделали, — это выяснили, как обойти это ограничение, чтобы публиковать сообщения на захваченном вики.
«Агенты использовали этот вики для обмена информацией друг с другом, в основном для того, чтобы помочь им успешно выполнить свою задачу», — пояснили исследователи, проанализировав тысячи сообщений, опубликованных на вики, все из которых доступны для ознакомления в отчете. «Они запрашивали ответы, обобщали результаты и делились методами обхода своих ограничений».
Агенты также пытались обобщить свои знания о поставленной задаче, чтобы предсказать, какие вопросы им будут заданы дальше, и даже настроили задачи для отслеживания активности, чтобы предсказать, приведет ли выполнение назначенных задач к их прекращению. Они также обсуждали использование Tor и других анонимизирующих сервисов для сокрытия своего трафика и начали реагировать, когда модератор сайта заметил их трафик и начал удалять сообщения.
Исследователи обнаружили все это, когда искали дополнительные случаи несанкционированной активности агентов ИИ после атаки на Hugging Face.
В электронном письме The Register OpenAI сообщила, что действовала прозрачно и добросовестно в отношении инцидентов с агентами ИИ, добровольно раскрывая такие вопросы и придерживаясь обязательства предоставлять точный отчет о том, что делают ее системы. Что касается того, почему они не упомянули немецкий инцидент при раскрытии информации об инциденте с Hugging Face, то, по словам представителя, это потому, что два инцидента были совершенно не связаны, как будто это может успокоить.
OpenAI добавила, что из отчета об инциденте с Hugging Face должно было быть очевидно, что это происходило неоднократно, указав нам на отрывок в своем посте в блоге об этом инциденте.
«При расследовании этого инцидента мы обнаружили редкие случаи, когда агенты без инструментов для взаимодействия нескольких агентов находили способы сотрудничать через побочные каналы во время обучения», — объясняется в отчете об инциденте с Hugging Face. «Мы считаем, что такое поведение возникло из-за обобщения данных, полученных в результате обучения нескольких агентов».
Другими словами, если мы не читали между строк, то это наша проблема.
Однако OpenAI отказалась предоставить дополнительные сведения.
Обманули дважды — позор мне
Как и в случае атаки на Hugging Face, одна из задач, поставленных агентам, была невыполнима в рамках установленных ограничений.
В случае с Hugging Face это была задача по кибербезопасности, на которую невозможно было ответить из «песочницы» агентов. В данном случае, по словам исследователей, задача заключалась в предоставлении статистики, доступной с панели Power BI. Для получения указанной статистики требовалась возможность выполнять GET-запросы, но агенты были ограничены POST-запросами.
В обоих случаях агенты OpenAI действовали вопреки своей программе, чтобы обойти ограничения, предположительно, в попытке решить поставленную перед ними проблему, которую нельзя было решить, не нарушая указаний операторов.
В данном случае агенты смогли сотрудничать и найти способ обойти ограничение, используя условие в своих «песочницах», которое исключало имена хостов Azure Blob Storage из защитного прокси. Когда агенты осознали это, они начали направлять трафик через эти имена хостов, чтобы избежать ограничений на GET-запросы. Именно через GET-запросы агенты получили права на запись в интернете, что и положило начало всему этому.
Сходство обоих инцидентов, в которых боты вырвались из своих «песочниц» и обошли ограничения при выполнении невыполнимой задачи, порождает очень важный вопрос: настолько ли некомпетентны инженеры OpenAI, что они дважды допустили ошибку в фундаментальных инструкциях, или компания намеренно ограничивает своих агентов, чтобы увидеть, на что они способны, при этом подвергая испытаниям весь интернет?
Кстати, сколько еще раз нам придется читать между строк корпоративного языка OpenAI, чтобы понять, что это происходило больше двух раз, о которых мы знаем на данный момент?
OpenAI, предсказуемо, не ответила на этот вопрос. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Brandon Vigliarolo




