Рутинное тестирование кибербезопасности передовых моделей ИИ привело к серии неожиданных инцидентов — самый серьезный случай произошел, когда модель Mythos 5 от Anthropic попыталась внедрить вредоносный код в приложение с открытым исходным кодом и создала поддельные личности, чтобы обмануть разработчиков, поддерживающих проект.
Инциденты произошли в конце июля во время кибероценки возможностей семи ведущих моделей ИИ, проведенной AI Security Institute (AISI) — исследовательской организацией при правительстве Великобритании. Исследователи обнаружили 19 случаев, когда «агенты ИИ предприняли несанкционированные действия в живом интернете, включая случаи, нацеленные на реальных людей и организации», согласно записи в блоге AISI, опубликованной 4 августа.
Почти все «автономные, несанкционированные» действия исходили от модели Mythos 5 от Anthropic, два таких действия — от GPT-5.6 Sol от OpenAI. Служба безопасности AI Security Institute впервые поняла, что что-то не так, утром 28 июля, когда ее коммерческая система мониторинга безопасности зафиксировала утечку данных с одной из тестовых систем через анонимную сеть Tor.
Следует четко пояснить: это не был случай, когда агенты ИИ выбрались из виртуальной тестовой песочницы и устроили хаос в живом интернете. Напротив, исследователи намеренно разрешили агентам ИИ доступ в интернет в рамках процесса кибертестирования. Исследователи также отключили некоторые киберклассификаторы, встроенные разработчиками моделей для предотвращения злоупотреблений.
Все попытки агентов ИИ нацелиться на реальных людей и организации провалились, и последующее расследование не выявило никакого реального ущерба. Однако исследователи охарактеризовали действия агентов ИИ как «первый случай, когда мы так clearly увидели риски, связанные с автономией и обманом, без специального промпта, в реальном мире».
Уловки AI-агента
Самый серьезный случай включал несколько попыток Mythos выполнить атаку на цепочку поставок на репозиторий проекта с открытым исходным кодом, размещенный на платформе для разработчиков GitHub, включая использование методов социальной инженерии, чтобы убедить разработчиков репозитория объединить вредоносный код.
,
После того как Mythos сначала открыл pull request для слияния вредоносного кода в репозиторий, он создал поддельные онлайн-персонажи «sock puppet», которые якобы независимо проверили и подтвердили, что код не содержит вредоносного ПО.
Агент ИИ также отправил пять писем двум разработчикам репозитория, включая письма с вредоносным ПО и попытки убедить разработчика принять pull request.
Mythos даже открыл GitHub Issue во втором репозитории, также принадлежащем одному из разработчиков первого репозитория, который содержал промпт-инъекцию с вредоносными инструкциями, нацеленными на «AI-агентов для триажа issues». Эта линия атаки возникла из рассуждений Mythos о том, что разработчик репозитория может быть AI-агентом для кодирования, таким как Claude Code.
Для сравнения, GPT-5.6 Sol от OpenAI совершила два несанкционированных действия, пытаясь решить назначенную задачу по кибербезопасности: атаковать симулированные сети и получить флаг. Действия агента ИИ были подробно описаны как исследователями AISI, так и OpenAI в собственной записи в блоге компании.
В первом несанкционированном действии GPT-5.6 Sol повторно использовала GitHub-токен, оставленный агентом ИИ другой лаборатории в общедоступном онлайн-блокноте, чтобы проверить, проверяет ли целевая сеть GitHub на наличие обновлений. Затем она «попыталась обойти восстановление учетной записи и ограничения на запросы», — написала OpenAI. Модель OpenAI также зарегистрировала учетные записи у внешних DNS- и туннельных провайдеров за пределами виртуальной тестовой среды.
Во втором действии GPT-5.6 Sol «использовала публичный туннельный сервис, чтобы сделать DNS-сервер, работающий локально в ее среде оценки, доступным из публичного интернета», — сообщает OpenAI. Сервер содержал полезные нагрузки, предназначенные для эксплуатации известной уязвимости в программном обеспечении, работающем в среде оценки, но настройка агента ИИ не сработала.
AI Security Institute опубликовал подробный технический отчет обо всех несанкционированных действиях агентов ИИ.
Извлеченные уроки
Инциденты побудили исследователей британского правительства из AI Security Institute остановить все связанные оценки агентов ИИ, изолировать соответствующие виртуальные машины и отключить внутренний доступ организации к наиболее capable моделям.
,
AI Security Institute также уведомила GitHub о вредоносной деятельности, выполненной агентами ИИ, и помогла платформе для разработчиков удалить любые «артефакты, оставленные агентом», а также уведомила пользователей GitHub, с которыми модель взаимодействовала.
Но более важные уроки касаются того, как правительственная организация планирует изменить кибертестирование таких ведущих моделей ИИ в будущем — и как она рекомендует поступать другим организациям.
Во-первых, она планирует ужесточить доступ в интернет для моделей ИИ во время кибертестирования, вместо того чтобы по умолчанию предоставлять открытый доступ. Это, предположительно, будет включать «мелкозернистый сетевой контроль для всех внутренних систем песочницы» и «эшелонированную защиту с сетевым контролем на нескольких уровнях», — говорится в техническом отчете.
Во-вторых, организация внедряет мониторинг кибероценок в реальном времени, который может «помечать или блокировать действия, выходящие за рамки, по мере их выполнения», — согласно AISI. Это предполагает использование отдельной большой языковой модели, которая может одобрять или отклонять действия, запрашиваемые моделями ИИ, проходящими кибертестирование, что поможет остановить несанкционированные действия. Мониторинг на основе LLM будет настраиваться с инструкциями о том, что должно или не должно быть разрешено в ходе конкретной кибероценки.
В-третьих, исследователи британского правительства планируют пересмотреть кибероценки, вложив дополнительные «инженерные усилия в изоляцию и укрепление песочницы», чтобы снизить риск побега моделей ИИ из виртуальных тестовых песочниц, хотя побегов в этих инцидентах не произошло. Они также пересматривают промпты для кибертестов, чтобы избежать случаев «неправильной конфигурации промпта», когда агенты ИИ, столкнувшись с задачами, которые они не могут выполнить в указанных ограничениях, с большей вероятностью предпримут несанкционированные действия.
Однако вышедшие из-под контроля события кибертестирования вновь подчеркивают риски кибербезопасности, связанные с ведущими моделями ИИ — особенно учитывая, что Anthropic и OpenAI недавно также раскрыли отдельные инциденты, в которых их модели ИИ вторглись в защищенные сети внешних организаций. Разумно ожидать, что это может повториться и в других обстоятельствах, когда модели используются недобросовестными или менее осведомленными в вопросах безопасности людьми.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Jeremy Hsu




