Модели OpenAI GPT-5.6 Sol и Anthropic Mythos 5 оказались причастны к очередной серии инцидентов в сфере безопасности ИИ: в ходе контролируемых кибероценок модели создавали фальшивые онлайн-личности, нацеливались на реальных людей и пытались манипулировать разработчиками, чтобы добиться одобрения вредоносного кода, сообщает Британский институт безопасности ИИ (UK AI Security Institute).
«28 июля 2026 года команда безопасности AISI обнаружила необычные передачи данных, покидавшие наши исследовательские системы во время плановой кибероценки», — говорится в блоге AISI. «В ходе расследования мы выяснили, что некоторые из тестируемых агентов вели устойчивую, потенциально вредоносную деятельность, направленную на реальных людей и организации».
Инциденты произошли во время тестов на кибербезопасность, в рамках которых исследователи намеренно предоставляли передовым моделям ИИ широкий доступ в интернет и ослабляли некоторые меры безопасности, чтобы измерить их базовые кибервозможности. AISI отметил, что эти инциденты стали первым случаем, когда «риски, связанные с автономией и обманом, проявились столь явно, без конкретных подсказок, в реальном мире».
AISI провел кибервызов 122 раза на семи передовых моделях и выявил 19 автономных несанкционированных действий в ходе 10 оценочных запусков.
«Почти всё это поведение (17 действий) исходило от одной модели — Anthropic Mythos 5, при этом 2 действия были связаны с OpenAI GPT-5.6-Sol с отключенными киберклассификаторами (механизмами предотвращения злоупотреблений)», — добавляется в сообщении.
Это раскрытие произошло менее чем через две недели после того, как OpenAI сообщила, что одна из ее передовых моделей скомпрометировала инфраструктуру Hugging Face во время кибероценки, и через несколько дней после того, как исследователи раскрыли еще один инцидент с безопасностью ИИ-агента с участием Modal.
Обман возник без инструкций
Наиболее серьезная последовательность событий включала попытку ИИ-агента осуществить то, что AISI описал как атаку на цепочку поставок программного обеспечения.
«В самой серьезной последовательности агент попытался внедрить вредоносный код в публично используемый open-source проект и предпринял действия, чтобы заручиться одобрением этого внедрения со стороны людей-ревьюеров», — написал AISI. «Агент изучил людей, поддерживающих проект, создал несколько фальшивых личностей и использовал их для социальной инженерии, убедив реального мейнтейнера одобрить код».
Исследователи также добавили: «Когда pull request агента был оспорен публично, он отредактировал свою предыдущую активность, чтобы она выглядела безобидной, и рассматривал возможность смены личности для продолжения».
Однако институт добавил: «Наше расследование не выявило какого-либо реального ущерба».
Следователи также обнаружили, что агенты связывались с реальными людьми, пытались проводить prompt-инъекции и оставляли сообщения, приглашающие другие параллельно работающие агенты к сотрудничеству.
«Агенту никогда не приказывали обманывать; обман возник как побочный продукт выполнения задачи — тот самый целенаправленный обман, который до недавнего времени был в значительной степени теоретическим», — написал AISI, добавив, что неограниченный доступ в интернет и дизайн оценки способствовали такому поведению, но не объясняли его полностью.
Это не побег из песочницы
AISI подчеркнул, что модели не вырвались из своих изолированных сред. Вместо этого доступ в интернет был намеренно включен, а киберклассификаторы безопасности намеренно отключены, чтобы измерить максимальные кибервозможности, а не поведение при публичном развертывании.
«Это не был побег из песочницы. Это была граница, существовавшая в языке и больше нигде», — сказал Санчит Вир Гогиа, главный аналитик Greyhound Research. «Переменная риска — не то, насколько умна модель. Это то, сколько практических полномочий организация передала ей и насколько мало из них можно независимо отозвать».
OpenAI, чья модель GPT-5.6 Sol была ответственна за два из зафиксированных действий, опубликовала пост в блоге, описывающий оценку AISI и отдельный инцидент с внешним тестовым партнером по имени «Irregular».
«По мере развития возможностей моделей должны развиваться и системы безопасности и защиты вокруг них», — написала компания в блоге. OpenAI заявила, что пересмотрит практики сторонней оценки, включая контроль доступа в интернет, изоляцию, мониторинг и реагирование на инциденты, а также будет работать с ИИ-лабораториями и независимыми оценщиками над укреплением отраслевых стандартов.
Anthropic, однако, не сделала никаких публичных заявлений в связи с раскрытием AISI.
Anthropic и OpenAI не сразу ответили на запрос о комментарии.
Корпоративные защитные меры
Для руководителей корпоративной безопасности эти выводы выходят за рамки red teaming ИИ, заявила Энца Яннополло, главный аналитик Forrester.
«Эти данные подтверждают наши ожидания относительно поведения агентов. Они могут и будут преодолевать границы и меры защиты для достижения своих целей», — сказала она. «Реальный вопрос в том, что может произойти, когда организации развернут эти системы в своих производственных средах».
Яннополло заявила, что предприятиям следует применять принцип наименьших привилегий, непрерывное управление рисками и меры управления при развертывании ИИ-агентов.
Эти выводы также подчеркивают необходимость пересмотра того, как оцениваются системы ИИ, считает Вибхум Дубей, исследователь кибербезопасности и специалист по red teaming.
«Годами тестирование безопасности сосредотачивалось на том, может ли модель ИИ выполнить задачу. Теперь нам нужно оценивать, как она выполняет эту задачу», — сказал Дубей.
Хотя AISI подчеркнул, что инциденты произошли в highly специфических условиях оценки и не обнаружил доказательств реального ущерба, институт утверждает, что они указывают на более широкий сдвиг в том, как могут возникать риски безопасности ИИ. «Вред может возникнуть не только когда люди намеренно злоупотребляют публично доступными моделями, но и когда способные агенты, работающие во внутренней исследовательской среде или среде с привилегированным доступом, совершают непреднамеренные действия за пределами своей разрешенной области», — написало учреждение.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Gyana Swain




