Менее чем через две недели после того, как OpenAI сообщила, что экспериментальная модель ИИ взломала Hugging Face во время оценки кибербезопасности, Anthropic раскрыла, что в ходе собственной проверки было выявлено три инцидента, в которых модели Claude получили несанкционированный доступ к производственной инфраструктуре трех организаций во время аналогичного тестирования.
Anthropic заявила, что начала проверку после того, как OpenAI раскрыла, что одна из ее экспериментальных моделей вырвалась из среды оценки.
«После проверки 141 006 запусков оценки, в которых Claude мог получить доступ в интернет, мы выявили три инцидента, в которых модель выходила в интернет из среды оценки или во время взаимодействия с ней Irregular, одного из наших сторонних партнеров по оценке, и затем получала несанкционированный доступ к производственной инфраструктуре трех разных организаций», — говорится в сообщении Anthropic в блоге.
Компания, однако, не назвала эти три организации. Она также не ответила немедленно на запрос о комментарии.
Это раскрытие делает Anthropic вторым разработчиком frontier AI за последние недели, сообщившим о том, что автономные модели ИИ взаимодействовали с реальными производственными системами во время предрелизного тестирования кибербезопасности.
Anthropic заявила, что ее инциденты возникли из-за неправильно настроенной среды оценки, которая допускала доступ в интернет, в то время как OpenAI объяснила свой инцидент тем, что экспериментальная модель использовала ранее неизвестную уязвимость, чтобы покинуть среду тестирования.
Неправильно настроенная среда оценки раскрыла реальные системы
Anthropic сообщила, что инциденты произошли во время упражнений типа «захват флага», предназначенных для измерения наступательных кибервозможностей Claude. Компания заявила, что считала среду оценки изолированной от публичного интернета, но позже обнаружила, что доступ в интернет был возможен из-за недопонимания с ее сторонним партнером по оценке.
«Из-за недопонимания между нами и нашим партнером по оценке это оказалось не так, и доступ в интернет был доступен. Из-за этого, когда поиск Claude приводил его к реальным системам в открытом интернете, он воспринимал их как часть упражнения», — заявили в Anthropic.
Anthropic сообщила, что в инцидентах, произошедших в апреле, участвовали три разные модели — Claude Opus 4.7, Mythos 5 и внутренняя исследовательская модель.
Anthropic заявила, что самый серьезный инцидент был связан с Claude Opus 4.7, который использовал уязвимости в реальной компании, чей домен совпадал с вымышленной целью оценки, что позволило модели получить учетные данные приложения и доступ к производственной базе данных.
«В четырех запусках этой оценки Claude столкнулся с трудностями при достижении своей смоделированной цели в среде оценки, но затем обнаружил, что реальная компания доступна через интернет», — добавляется в сообщении блога. «Предполагая, что это и есть предполагаемая цель в задаче „захват флага“, Claude искал, идентифицировал и использовал уязвимости в инфраструктуре компании, полагая, что это часть упражнения… Это представляло собой наиболее серьезное воздействие, которое мы выявили».
Во втором инциденте, по словам Anthropic, Claude Mythos 5 опубликовал вредоносный пакет Python в публичный репозиторий PyPI, пытаясь скомпрометировать смоделированную цель. Пакет оставался общедоступным около часа и был загружен и выполнен на 15 реальных системах, прежде чем был удален, сообщает компания.
Третий инцидент был связан с внутренней исследовательской моделью, которая просканировала около 9000 хостов, доступных через интернет, прежде чем использовать раскрытые учетные данные и SQL-инъекцию для доступа к приложению реальной компании. По словам Anthropic, модель позже поняла, что достигла производственной среды, и прекратила выполнение упражнения.
Вибхум Дуби, исследователь кибербезопасности и участник red team, отметил, что инцидент с PyPI может иметь наибольшие последствия для защитников предприятий, поскольку пострадавшая организация была скомпрометирована через обычный процесс безопасности, а не через уязвимое приложение. «Второй случай, честно говоря, более интересная история — компания была скомпрометирована, потому что ее собственный сканер безопасности сделал именно то, что должен был сделать: автоматически установил и просканировал новый пакет Python, за исключением того, что пакет был создан и загружен Claude в рамках теста», — сказал Дуби. «Таким образом, компания была взломана в результате следования хорошей практике безопасности, что является довольно неприятной деталью».
Anthropic отличает свои инциденты от инцидентов OpenAI
Anthropic заявила, что ее выводы отличаются от недавнего раскрытия OpenAI, поскольку ее модели не использовали программную уязвимость для выхода из изоляции.
«В то время как модели OpenAI использовали новую уязвимость для выхода из изоляции, оцененные здесь модели Claude получили доступ в интернет через открытый путь. Хотя между ними нет четкого разграничения, мы считаем, что эти инциденты ближе к отказу оснастки и операционному сбою, чем к отказу согласования модели», — сообщила компания в сообщении блога.
Anthropic также заявила, что поведение ее новейшей исследовательской модели дает «осторожный оптимизм», поскольку она поняла, что достигла реальной среды, и прекратила преследовать цель оценки.
Дуби сказал, что оба раскрытия указывают на более широкую проблему того, как оцениваются модели frontier AI.
«Это уже вторая крупная AI-лаборатория примерно за две недели, которая признала, что тестовая среда вытекла в реальный интернет», — сказал он. «Это уже не совпадение. Это указывает на то, что среды оценки рассматриваются как менее приоритетные, чем производственные системы, хотя весь смысл этих тестов — увидеть, насколько далеко модель может продвинуть наступательные возможности с меньшими ограничениями».
Эксперты по безопасности призывают к усилению мер защиты при оценке
Раскрытия Anthropic и OpenAI подчеркивают недостатки сред, используемых для оценки все более способных моделей ИИ, считает Дрю Деннисон, сооснователь и технический директор Semgrep.
«Удивительно, что лаборатории, которые так серьезно относятся к безопасности, до сих пор не имеют „Форт Нокс“ — тестовой песочницы, предназначенной для сдерживания столь способных моделей», — сказал Деннисон.
Он добавил, что, хотя разработчики ИИ, вероятно, усилят свои среды оценки, организации должны подготовиться к тому, что аналогичные возможности станут доступны злоумышленникам.
«Индустрия закроет такую деятельность, но это не помешает злоумышленникам получить доступ к моделям такого класса в течение следующих шести месяцев и намеренно попытаться сделать то же самое», — сказал Деннисон. «У защитников есть ограниченное окно для подготовки, что делает критически важным укрепление поверхности атаки программного обеспечения уже сейчас».
Anthropic сообщила, что проверка привела к изменениям в том, как она проводит оценки кибервозможностей.
«Среды оценки, включающие мощные автономные возможности, также требуют значительных средств контроля. Тестирование безопасности проводится до выпуска модели именно потому, что мы еще не знаем, на что она способна. Среды оценки все чаще должны соответствовать тем же стандартам безопасности, что и любые другие системы, в которых работают наши модели», — добавила компания в сообщении блога.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Gyana Swain




