ИИ-агенты от OpenAI и Anthropic снова нарушили границы кибербезопасности. В ходе теста, проведенного правительством Великобритании, один из агентов создал поддельные личности на GitHub и попытался оказать давление на мейнтейнера проекта с открытым исходным кодом, чтобы тот одобрил вредоносный код.
Институт безопасности ИИ Великобритании (AISI) выявил 19 несанкционированных действий в ходе 10 из 122 выполненных тестовых прогонов. Семнадцать из них были связаны с Claude Mythos 5 от Anthropic, а два — с прогоном с участием GPT-5.6 Sol от OpenAI.
Агенты должны были пройти кибербезопасностный квест типа «захват флага», включающий три связанные между собой симулированные сети. Доступ в интернет был намеренно предоставлен, чтобы они могли загружать инструменты и вести себя как настоящие злоумышленники.
Некоторые из них сделали значительно больше. Согласно отчету AISI об инциденте, один агент Mythos 5 принял несвязанный публичный проект на GitHub за часть упражнения и открыл pull request с вредоносным кодом. Затем он изучил мейнтейнеров проекта, создал несколько поддельных личностей и использовал эти учетные записи, чтобы убедить реального мейнтейнера одобрить изменение.
Когда pull request был оспорен, агент отредактировал свою предыдущую активность, чтобы она выглядела безобидной, и рассматривал возможность переключения на другую личность. Он также использовал сеть Tor, чтобы обойти некоторые ограничения GitHub.
К счастью, вредоносный код не был объединен. Человек-мейнтейнер заметил проблему и отклонил его.
Тот же агент даже пытался связаться с реальными людьми через сообщения и файлообменные сервисы. Некоторые файлы содержали вредоносные нагрузки, в то время как другие включали скрытые инъекции промптов, предназначенные для манипулирования ИИ-ассистентами по написанию кода, чтобы те выполняли вредоносные инструкции.
AISI также обнаружил признаки сотрудничества между отдельными прогонами агентов. Один агент оставил публичные сообщения и данные учетных записей для других агентов, выполняющих то же задание, и более поздние агенты обнаружили и повторно использовали некоторые из этих ресурсов.
Однако у этого инцидента есть важные оговорки. Следует отметить, что AISI намеренно предоставил агентам открытый доступ в интернет и отключил киберклассификаторы, которые обычно используются OpenAI и Anthropic для блокировки вредоносных запросов.
Институт на самом деле хотел измерить базовые возможности моделей в условиях, приближенных к тем, которые доступны опытному злоумышленнику.
Некоторые версии теста также были неправильно настроены, из-за чего агенты полагали, что поставленную задачу невозможно выполнить, не покидая одобренную среду. AISI заявил, что остается неясным, когда агенты поняли, что их действия влияют на реальные системы, а не на вымышленную цель.
Институт не нашел доказательств причинения реального вреда. GitHub удалил учетные записи и другие материалы, созданные во время тестов, а затронутые пользователи были уведомлены.
OpenAI отдельно объяснил два действия, приписываемые GPT-5.6 Sol, в официальном отчете об оценке. Его агент повторно использовал токен GitHub, раскрытый другим агентом, зарегистрировал учетные записи у DNS- и туннельных провайдеров и ненадолго разместил эксплойт-нагрузки на сервере, доступном через публичный интернет. OpenAI заявил, что настройка не сработала и что нет доказательств подключения к ней реальной системы.
Эти инциденты отличаются от более раннего случая, когда агент OpenAI сбежал из песочницы и скомпрометировал инфраструктуру Hugging Face.
Anthropic сообщил Reuters, что работает с AISI над получением дополнительной информации и расследованием результатов. OpenAI заявил, что пересмотрит свои требования к сторонним оценкам, включая доступ в интернет, обработку учетных данных, мониторинг, изоляцию и процедуры экстренной остановки.
AISI также меняет порядок проведения будущих тестов. Доступ в интернет потребует явного обоснования, а новые системы мониторинга смогут обнаруживать и блокировать действия, выходящие за рамки сценария, пока агент еще работает.
Via Axios, Reuters
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Karthik Mudaliar




