Во всех трех случаях модель Claude выходила в интернет из тестовой среды во время взаимодействия с третьей стороной, а затем получала несанкционированный доступ к рабочим системам этих организаций, сообщила Anthropic в блог-посте, описав, что было обнаружено и что компания планирует изменить, чтобы предотвратить повторение ситуации.
Anthropic заявила, что инцидент с OpenAI 21 июля побудил компанию провести собственную оценку кибербезопасности. Она специально искала доказательства того, что Claude выходил в интернет из тестовых сред, которые предназначены для работы в качестве изолированных сред (sandbox) и изоляции моделей.
Среди 141 006 проверенных прогонов оценки лаборатория ИИ обнаружила три инцидента, в которых ее модель выходила в интернет во время взаимодействия с Irregular, одним из ее сторонних партнеров. Anthropic сообщила, что доступ был связан с неправильной конфигурацией в среде оценки, запущенной с Irregular. Компания назвала это «недопониманием» между двумя компаниями относительно того, имела ли тестовая установка доступ в интернет, хотя на самом деле он был. Anthropic заявила, что не возлагает вину и «подходит к исправлениям так, как если бы ответственность лежала только на нас», отметив, что Irregular проводит собственное отдельное расследование.
Так или иначе, из-за этого открытого соединения модель получила несанкционированный доступ к производственной инфраструктуре трех разных организаций. Anthropic сообщила, что инциденты были связаны с тремя разными моделями Claude: Opus 4.7, Mythos 5 и внутренней исследовательской тестовой моделью.
Примечательно, что Anthropic заявила, что в каждом из этих случаев «Claude было прямо указано в нашем промпте, что у него нет доступа в интернет». Похоже, что модель ИИ предположила, что реальные системы являются частью упражнения, которое ее попросили выполнить.
Это предположение, как выяснилось, не подтвердилось повсеместно. Три модели вели себя по-разному, когда появились доказательства того, что их цели реальны, что Anthropic отметила как один из самых поразительных выводов.
Opus 4.7, самая старая из трех, распознала, что достигла реальной производственной системы, во всех четырех прогонах этого инцидента. В двух из них она рационализировала, что реальная компания, должно быть, каким-то образом является частью упражнения, но во всех четырех она продолжала атаку, включая извлечение учетных данных и обращение к базе данных с производственными данными. Mythos 5 также улавливала признаки того, что находится в реальном интернете, но убедила себя, что все еще находится в симуляции, и в итоге опубликовала вредоносный пакет программного обеспечения в публичный реестр Python PyPI, который был загружен и запущен внешними системами, прежде чем был обнаружен. Только внутренняя исследовательская тестовая модель, самая новая у Anthropic, остановилась сама, как только пришла к выводу, что цель реальна.
В ответ Anthropic заявила, что для таких оценок необходимы значительные меры контроля, если задействованы мощные модели ИИ, что перекликается с некоторыми мнениями в сообществе кибербезопасности.
Компания также отметила, что Claude работал без дополнительного мониторинга безопасности и классификаторов, которые она применяет к общедоступным моделям, — мер защиты, которые, по ее словам, заблокировали бы такое поведение, поскольку оценки предназначены для измерения базовых возможностей модели.
Важно отметить, что Anthropic заявила, что не нашла доказательств того, что какая-либо модель «преследовала собственную цель», а вместо этого просто пыталась выполнить поставленную задачу.
Хотя сравнения между двумя инцидентами неизбежны, Anthropic провела четкое различие между своими инцидентами и инцидентами OpenAI, отметив, что в то время как модель OpenAI использовала неизвестную уязвимость программного обеспечения, чтобы вырваться из своей тестовой среды, модели Anthropic вместо этого выходили в интернет через путь, который по ошибке был оставлен открытым.
OpenAI продолжает публиковать новые подробности о своем собственном взломе, заявляя, что ее модели также использовали публично раскрытые учетные данные в четырех учетных записях в четырех сервисах: один в качестве промежуточной точки, один для хранения и два, которые были только просмотрены, а не использованы для дальнейшего проникновения, согласно обновленному блог-посту OpenAI об инциденте.
Anthropic также провела различие между собой и OpenAI, отметив, что она сама обнаружила инциденты в ходе упреждающей проверки, и что две затронутые организации, с которыми ей удалось связаться, ранее не обнаружили эту активность и не сообщили о ней в Anthropic.
Компания добавила, что сейчас работает с независимой группой оценки METR над сторонней проверкой инцидентов.
Случайный взлом Hugging Face компанией OpenAI, который стал первым подтвержденным случаем потери контроля над моделью ИИ лабораторией, вызвал волну реакций со стороны отрасли и политиков, многие из которых не обязательно согласны друг с другом. Это последнее раскрытие информации от Anthropic гарантирует, что дебаты о моделях ИИ и безопасности продолжатся.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Kirsten Korosec




