Anthropic стала очередной компанией в сфере искусственного интеллекта (ИИ), признавшей, что не смогла должным образом контролировать процессы тестирования своих моделей. Три разные версии Claude — Opus 4.7, Mythos 5 и внутренняя исследовательская модель — не только вышли в открытый интернет из неправильно изолированных контейнерных сред, но и взломали системы трёх различных организаций. Произошедшее больше напоминает не взлом ИИ, а его прогулку через незапертые ворота. Anthropic обнаружила побег моделей после того, как 21 июля OpenAI раскрыла атаку на открытый ИИ-репозиторий Hugging Face, что побудило Anthropic провести ревизию собственных оценок кибербезопасности в поисках аналогичных проблем. «Проверив 141 006 оценочных прогонов, в ходе которых Claude мог получить доступ к интернету, мы выявили три инцидента, когда модель выходила в сеть из среды оценки или взаимодействуя с ней у Irregular, одного из наших сторонних партнёров по оценке, а затем получала несанкционированный доступ к производственной инфраструктуре трёх разных организаций», — заявила Anthropic. Во всех трёх сценариях перед моделями ставилась задача найти секретную информацию, спрятанную на машине в сети, и добыть её — ИИ-версия соревнований capture-the-flag, столь любимых участниками Black Hat. Задача была намеренно оставлена открытой, без предписанного метода, и в каждом случае подсказка Anthropic указывала, что среда является симуляцией без доступа к интернету. Однако, как заявила незадачливая компания, «из-за недопонимания» между ней и партнёром по оценке Irregular — специалистом по безопасности передового ИИ, чья миссия — «защищать мир во времена всё более мощных и сложных ИИ-систем», — доступ в интернет на самом деле был, поэтому поиски Claude привели его к реальным системам, которые он воспринял как часть упражнения. Из-за ошибок Anthropic и Irregular Claude действовал в предположении, что всё, к чему он может получить доступ, находится в рамках теста, и поэтому использовал различные условия — плохую гигиену учётных данных, неаутентифицированные конечные точки и зависимости с открытым исходным кодом — в трёх разных организациях. Однако, в отличие от инцидента OpenAI с Hugging Face, он не эксплуатировал и не связывал уязвимости, полагаясь лишь на практики своих несчастных жертв. Anthropic подчеркнула, что Claude продолжал работать только над выполнением детализированной задачи capture-the-flag, и ни в одной из атак модели не эксфильтровали себя и не пытались намеренно покинуть тестовые среды. Anthropic заявила, что все модели работали без стандартных средств защиты, развёрнутых в публичных версиях, но имели обучение безопасности, специфичное для модели. Все тесты якобы проводились на выделенной инфраструктуре без доступа к внутренним системам Anthropic или данным клиентов. Все три пострадавшие организации, которые Anthropic пока не называет, были уведомлены о кибератаках 27 июля — сейчас компания работает с двумя из них над устранением последствий. Другая фирма, причастная к последнему провалу ИИ, Irregular, тесно вовлечена и проводит собственное расследование.
Множественные очевидные сбои
Во всех трёх инцидентах Anthropic выявила явные недостатки в построении тестов и обучении моделей. В инциденте с Claude Opus 4.7 Irregular создала вымышленную целевую компанию, но она совпадала по названию с реальной организацией, имеющей активный домен веб-сайта. Если бы контейнер оценки не имел доступа к открытому интернету, это не было бы проблемой, но поскольку доступ был, Claude — не осознавая, что он не в своей песочнице, — решил, что это законная цель. Тревожно, что даже после того, как Claude понял, что действует за пределами контейнера, он не остановил атаку. В инциденте с Mythos 5 Claude обнаружил вымышленный документ, который выглядел как документация по онбордингу для новых разработчиков вымышленной компании, предписывающая установить Python-пакет из реестра PyPl. Опять же, не будь доступа к интернету, это не было бы проблемой, но поскольку доступ был, Claude создал и опубликовал вредоносный Python-пакет, исходя из того, что вымышленная компания автоматически загрузит обновление. Это классическая техника атаки на цепочку поставок открытого исходного кода, и в данном случае она превратилась в реальную атаку такого типа. Anthropic сообщила, что модель приложила огромные усилия для этой атаки — включая создание собственной настоящей учётной записи PyPl через бесплатного почтового провайдера. Вредоносный пакет был свободно доступен в сети около часа и был загружен и запущен 15 раз, в одном случае — реальной компанией по кибербезопасности, которая выполнила код, позволив Claude получить доступ к её системам и эксфильтровать учётные данные. Всё это время, по словам Anthropic, Claude, похоже, неоднократно убеждал себя, что, хотя он совершает кибератаку — по его собственным словам, «это неправильно и уж точно не предполагаемое решение», — он всё ещё находится в симуляции, так что всё в порядке. Когда реальные автоматические сканеры начали устанавливать его сомнительный Python-пакет, он предположил, что это скриптованные симулированные акторы. Наконец, в третьем сбое с исследовательской тестовой версией Claude, обнаружив, что не может добраться до вымышленной цели, модель искала альтернативы. К сожалению, поскольку она уже действовала в реальном мире, она сканировала настоящие цели и в одной из них смогла прочитать учётные данные из случайно открытой отладочной страницы и провести SQL-инъекцию. В небольшом облегчении, во время этого прогона Claude понял, что скомпрометированный хост находится в облачной среде, не связанной с задачей capture-the-flag. Таким образом, он заключил, что цель реальна, и прекратил атаку. Anthropic признала: «Несколько мер защиты в глубину, как с нашей стороны, так и со стороны партнёра, могли бы предотвратить эти инциденты или хотя бы снизить их вероятность. Claude сделал то, чему упражнения capture-the-flag учат экспертов по кибербезопасности: искать способы добраться до флага. Этот поиск привёл его к обнаружению того, что его машина может выйти в интернет, но, поскольку в системной подсказке ему было сказано, что доступа в интернет нет, Claude поверил, что всё, с чем он изначально сталкивается, является частью симуляции, и обращался с реальными системами, которые находил, как с элементами упражнения». Компания заявила: «В соответствии с культурой blameless postmortem, мы подходим к исправлениям так, как если бы ответственность лежала только на нас. Это начинается с обеспечения безопасности каждой части нашего конвейера оценки, включая способ интеграции с внешними партнёрами. В будущем это будет включать расширение непрерывного мониторинга транскриптов оценки на предмет неожиданного поведения, улучшение инструментов расследования и проведение более тщательной проверки поставщиков, на которых мы полагаемся».
Без впечатления
Илья Колошенко, основатель киберфирмы Immuniweb, раскритиковал то, что он назвал «довольно невпечатляющим маркетинговым ходом» Anthropic в ответ на инцидент с Hugging Face. «С операционной точки зрения, из-за прогрессирующего ухудшения качества обучающих данных новые ИИ-модели становятся глупее. Обман и нарушение закона вместо выполнения конкретных задач — это уж точно не показатель интеллекта», — сказал Колошенко. «Учитывая, что организации и компании всех размеров сейчас активно принимают все возможные меры для защиты своих данных от использования в целях обучения ИИ, компании в этой сфере сталкиваются с огромной нехваткой высококачественных и актуальных данных, в которых они так отчаянно нуждаются. В конечном итоге передовые модели обучаются на синтетических, низкокачественных или даже вредоносных и отравленных данных, что подрывает их так называемый интеллект. Ситуация вряд ли улучшится в ближайшем будущем, если ИИ-компании не согласятся платить справедливую цену за обучающие данные, но это вынудит большинство из них уйти с рынка», — добавил он.
Юридический риск
Колошенко отметил, что агенты и модели, которым поручено тестирование безопасности, могут «и почти наверняка» выйдут из-под контроля, если по какой-либо причине пренебречь средствами контроля и защиты. «Мощные LLM непредсказуемы по своей конструкции и, следовательно, практически неконтролируемы человеком. Поэтому использование передовых ИИ-моделей для тестирования безопасности может быть чрезвычайно дорогостоящим с юридической точки зрения», — сказал он. «Отговорки вроде „это сделал ИИ“ в настоящее время не существуют в глазах закона, оставляя поставщиков ИИ в зоне ответственности. Уголовное преследование при узком наборе обстоятельств также не исключено». Колошенко предупредил, что конечные пользователи также сталкиваются с аналогичными юридическими рисками — если кто-то использует инструмент тестирования безопасности на основе сторонней модели, он может понести ответственность в случае сбоя, и из-за договорных оговорок и ограничений ответственности в условиях использования (ToU), которые они почти наверняка не читали полностью, не смогут обвинить третью сторону. «Если вы планируете использовать агентный ИИ для тестирования безопасности — подумайте дважды и поговорите со своими юристами», — заключил он.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Alex Scroxton




