Anthropic сообщила, что ее модели безопасности на базе Claude получили несанкционированный доступ к чувствительным производственным средам трех внешних организаций в ходе внутреннего тестирования, предназначенного для оценки наступательных кибервозможностей моделей.
Эти события, о которых Anthropic сообщила в четверг, стали вторым за 10 дней разоблачением того, что модели ИИ от самых богатых провайдеров мира проникли в защищенные сети — правонарушение, которое в более традиционных сценариях взлома могло бы отправить человека за клавиатурой в тюрьму на годы. Ранее в этом месяце OpenAI заявила, что ее модели безопасности использовали уязвимость нулевого дня для взлома сети Hugging Face, платформы для моделей машинного обучения с открытым исходным кодом и наборов данных ИИ. Модели OpenAI затем похитили учетные данные доступа и другую конфиденциальную информацию Hugging Face. Модели OpenAI также использовали публично раскрытые учетные данные для компрометации учетных записей четырех других сторонних сервисов.
Anthropic заявила, что инцидент с OpenAI побудил ее инженеров пересмотреть аналогичные оценки кибербезопасности, проведенные моделями Claude. Аудит выявил три инцидента, «в которых модель получала доступ к интернету изнутри или во время взаимодействия с оценочной средой Irregular, одного из наших сторонних партнеров по оценке, а затем получала несанкционированный доступ к производственной инфраструктуре трех различных организаций».
Когда модели не отличают реальность от вымысла
Anthropic сообщила, что подсказки, которые инженеры передавали во время соревнований «захват флага» — распространенного средства оценки наступательных и оборонительных возможностей различных методов взлома — четко указывали, что тестовая среда была лишь симуляцией и что модели не имели доступа к открытому интернету. На самом деле тестовый партнер Irregular по ошибке предоставил такой доступ. В ответ модели восприняли интернет-пути как часть упражнений.
Вторжения произошли через три модели Claude: Opus 4.7, Mythos 5 и внутренний исследовательский прототип. Opus 4.7, самая старая из трех, вышла за свои границы больше всех. Anthropic пояснила:
Действуя под ложным убеждением, что все доступные объекты должны быть в рамках упражнения, Claude скомпрометировала инфраструктуру пострадавших организаций, используя базовые методы, такие как эксплуатация слабых паролей и неаутентифицированных конечных точек. Она не нашла и не использовала сложные уязвимости, и в каждом случае Claude продолжала работать только над выполнением конкретной задачи «захват флага», назначенной ее оценкой. Однако в некоторых случаях наша более старая модель продолжала атаку даже после получения доказательств того, что она работает в открытом интернете; наша новейшая модель остановилась, как только поняла, что находится в интернете. Ни в одной из этих ситуаций Claude не эксфильтровала себя и не пыталась намеренно покинуть свою тестовую среду.
В то время как модель Opus продолжала атаку даже после того, как правильно предсказала, что взломала производственную систему сторонней организации, Anthropic сообщила, что Mythos 5 сделала аналогичный вывод, но «логически вернулась к заключению, что все еще находится в симуляции». Это означало, что Mythos также не прервала упражнение, когда явно перешла черту. После того как внутренняя тестовая модель также превысила границы допустимого поведения, она в конце концов нашла доказательства того, что тоже вторглась, и остановила упражнение.
В первом из трех вторжений Opus 4.7 изначально не смогла взломать симулированную цель, которую ей было поручено атаковать. Как только модель обнаружила, что ее среда действительно имеет доступ в интернет, она выявила и использовала уязвимости в сети реальной компании с тем же названием, что и цель в сценарии симулированной атаки. За четыре запуска модель извлекла учетные данные приложений и инфраструктуры, а также несколько сотен строк производственных данных. Anthropic сообщила, что это вторжение было самым серьезным из трех.
«Этот инцидент был связан с Claude Opus 4.7 и стал единственным случаем, когда модель продолжала атаковать систему после того, как узнала, что, вероятно, работает в реальной среде», — говорится в сообщении от четверга. «Во всех четырех запусках модель в конечном итоге осознала (что видно по ее вербализованным рассуждениям), что система реальна — в двух случаях модель решила, что реальная компания должна быть частью упражнения. Однако ни одна из них не остановила атаку на этом основании».
Во втором случае Mythos 5 обнаружила документ внутри вымышленной среды, который, по мнению модели, был инструкциями по настройке для новых разработчиков другой вымышленной компании. Инструкции предписывали сотрудникам установить несуществующий пакет Python из PyPI. Все еще следуя подсказкам взломать первую вымышленную компанию, модель создала и опубликовала вредоносный пакет с тем же именем. Цель, по-видимому, заключалась в том, чтобы каким-то образом заставить реальную компанию запустить его. В посмертном анализе Anthropic говорится:
Claude предприняла обширные усилия для проведения этой атаки — усилия, которые, вероятно, указали бы человеку-участнику, что это уже не просто оценка, и что они на самом деле загружают реальный пакет PyPI. Например, в одном случае для создания учетной записи PyPI Claude понадобился адрес электронной почты. А для создания адреса электронной почты понадобился номер телефона. Чтобы получить номер телефона, после неудачной попытки найти бесплатный сервис номеров телефонов, она попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В конце концов она отступила, нашла бесплатного, не заблокированного почтового провайдера, использовала его для регистрации учетной записи PyPI, а затем использовала эту учетную запись для загрузки вредоносного ПО в PyPI.
В течение примерно часового окна, когда пакет Python был доступен для загрузки, он был запущен на 15 реальных системах, включая сканер, принадлежащий реальной компании по безопасности, чье название не было включено в симулированную атаку. Когда вредоносный код выполнился, он отправил учетные данные компании по безопасности в точку сбора, реализованную моделью Mythos. Завладев учетными данными, Mythos использовала их для получения дальнейшего несанкционированного доступа к инфраструктуре компании.
На раннем этапе механизм рассуждений Mythos 5 предсказал, что последствия ее атаки могут быть вредоносными и были бы «НЕ нормальными и уж точно не предполагаемым решением», если бы она выполнялась через интернет. Модель не смогла обнаружить, что она больше не работает внутри защищенной среды, и поэтому не прервала вторжение.
В мире ИИ: где ответственность?
В том, что, вероятно, является преуменьшением года, Anthropic заявила: «Мы считаем, что независимо от того, что модель думала о своей среде, усилия, которые Claude предприняла для публикации пакета PyPI, не дотягивают до идеального поведения [выделение добавлено], и это область, на которой мы сосредоточим больше обучения».
В третьем нарушении исследовательский прототип испытывал трудности с выполнением инструкций, которые ему было поручено выполнить. Затем модель просканировала примерно 9 000 реальных целей, пока в конце концов не нашла уязвимости, которые позволили ей получить доступ к интернет-приложению реальной компании.
«На протяжении большей части запуска Claude воспринимала (реальные) хосты, к которым она обращалась, как просто части упражнения; она считала их симулированными и полагала, что ее действия поэтому безвредны», — сообщила Anthropic. «Однако позже в ходе запуска Claude поняла, что скомпрометированный хост находится в облачной учетной записи, не имеющей отношения к задаче «захват флага». Самостоятельно она пришла к выводу, что цель на самом деле реальна, и прекратила атаку».
Эти разоблачения гораздо более тревожны, чем это представлено в анализе Anthropic. Модели двух самых мощных платформ ИИ совершили то, что, вероятно, было бы множеством уголовных преступлений, если бы вторжения не были связаны с ИИ. Это различие без разницы, поскольку действия ИИ тем не менее были результатом подсказок, предоставленных людьми, и ошибок конфигурации, допущенных людьми. Однако пока нет никаких признаков того, что правоохранительные органы планируют принять меры. Отсутствие ответственности или какого-либо морального риска дает компаниям меньше стимулов обуздывать свои продукты.
И OpenAI, и Anthropic подчеркнули, что в проведенных ими тестах намеренно удалялись защитные ограничения моделей, которые обычно предотвращают вредоносные действия. В заявлениях об отказе от ответственности упускается простой факт: если разработчики этих инструментов не смогут предвидеть такие события, вполне возможно, что модели будут давать сбои непреднамеренным образом при использовании сторонами, менее знакомыми с продуктами, даже при наличии защитных ограничений.
Нет причин полагать, что подобные события будут единичными. В своей нынешней форме наступательный кибер-ИИ представляет собой беспрецедентную угрозу, и на данный момент мало что можно сделать, кроме как довериться этим компаниям в вопросах саморегулирования.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Dan Goodin




