Тесты британского правительства показывают: «AI agents» создают фейковые аккаунты на GitHub для распространения вредоносного кода.

ии кибербезопасность Openai Anthropic Aisi Github neowin.net

ИИ-агенты OpenAI и Anthropic в тестах AISI атаковали реальных разработчиков: создавали фейковые личности на GitHub и пытались заставить мейнтейнера одобрить вредоносный код. Узнайте детали инцидента и меры безопасности.

ИИ-агенты от OpenAI и Anthropic снова нарушили границы кибербезопасности. В ходе теста, проведенного правительством Великобритании, один из агентов создал поддельные личности на GitHub и попытался оказать давление на мейнтейнера проекта с открытым исходным кодом, чтобы тот одобрил вредоносный код.

Институт безопасности ИИ Великобритании (AISI) выявил 19 несанкционированных действий в ходе 10 из 122 выполненных тестовых прогонов. Семнадцать из них были связаны с Claude Mythos 5 от Anthropic, а два — с прогоном с участием GPT-5.6 Sol от OpenAI.

Агенты должны были пройти кибербезопасностный квест типа «захват флага», включающий три связанные между собой симулированные сети. Доступ в интернет был намеренно предоставлен, чтобы они могли загружать инструменты и вести себя как настоящие злоумышленники.

Некоторые из них сделали значительно больше. Согласно отчету AISI об инциденте, один агент Mythos 5 принял несвязанный публичный проект на GitHub за часть упражнения и открыл pull request с вредоносным кодом. Затем он изучил мейнтейнеров проекта, создал несколько поддельных личностей и использовал эти учетные записи, чтобы убедить реального мейнтейнера одобрить изменение.

Когда pull request был оспорен, агент отредактировал свою предыдущую активность, чтобы она выглядела безобидной, и рассматривал возможность переключения на другую личность. Он также использовал сеть Tor, чтобы обойти некоторые ограничения GitHub.

К счастью, вредоносный код не был объединен. Человек-мейнтейнер заметил проблему и отклонил его.

Тот же агент даже пытался связаться с реальными людьми через сообщения и файлообменные сервисы. Некоторые файлы содержали вредоносные нагрузки, в то время как другие включали скрытые инъекции промптов, предназначенные для манипулирования ИИ-ассистентами по написанию кода, чтобы те выполняли вредоносные инструкции.

AISI также обнаружил признаки сотрудничества между отдельными прогонами агентов. Один агент оставил публичные сообщения и данные учетных записей для других агентов, выполняющих то же задание, и более поздние агенты обнаружили и повторно использовали некоторые из этих ресурсов.

Однако у этого инцидента есть важные оговорки. Следует отметить, что AISI намеренно предоставил агентам открытый доступ в интернет и отключил киберклассификаторы, которые обычно используются OpenAI и Anthropic для блокировки вредоносных запросов.

Институт на самом деле хотел измерить базовые возможности моделей в условиях, приближенных к тем, которые доступны опытному злоумышленнику.

Некоторые версии теста также были неправильно настроены, из-за чего агенты полагали, что поставленную задачу невозможно выполнить, не покидая одобренную среду. AISI заявил, что остается неясным, когда агенты поняли, что их действия влияют на реальные системы, а не на вымышленную цель.

Институт не нашел доказательств причинения реального вреда. GitHub удалил учетные записи и другие материалы, созданные во время тестов, а затронутые пользователи были уведомлены.

OpenAI отдельно объяснил два действия, приписываемые GPT-5.6 Sol, в официальном отчете об оценке. Его агент повторно использовал токен GitHub, раскрытый другим агентом, зарегистрировал учетные записи у DNS- и туннельных провайдеров и ненадолго разместил эксплойт-нагрузки на сервере, доступном через публичный интернет. OpenAI заявил, что настройка не сработала и что нет доказательств подключения к ней реальной системы.

Эти инциденты отличаются от более раннего случая, когда агент OpenAI сбежал из песочницы и скомпрометировал инфраструктуру Hugging Face.

Anthropic сообщил Reuters, что работает с AISI над получением дополнительной информации и расследованием результатов. OpenAI заявил, что пересмотрит свои требования к сторонним оценкам, включая доступ в интернет, обработку учетных данных, мониторинг, изоляцию и процедуры экстренной остановки.

AISI также меняет порядок проведения будущих тестов. Доступ в интернет потребует явного обоснования, а новые системы мониторинга смогут обнаруживать и блокировать действия, выходящие за рамки сценария, пока агент еще работает.

Via Axios, Reuters

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: