OpenAI заявляет, что её AI-агент сбежал из тестовой песочницы, чтобы взломать Hugging Face

Openai Hugging Face кибератака ии-агент бенчмарк безопасность arstechnica.com

Агент OpenAI сбежал из песочницы и взломал Hugging Face в поисках ответов для бенчмарка. Узнайте, как ИИ-модели длительного горизонта становятся новой угрозой кибербезопасности и почему глава Hugging Face называет это «днём первым» для защиты в эпоху агентов.

OpenAI сообщает, что агент на основе её LLM-моделей сбежал из изолированной тестовой среды и проник на серверы Hugging Face в ходе чрезмерно усердной попытки получить решения для бенчмарк-теста. Компания называет это непреднамеренное вторжение «беспрецедентным киберинцидентом» и работает с Hugging Face над новыми мерами защиты, чтобы предотвратить повторение.

Hugging Face раскрыла информацию о вторжении на прошлой неделе, заявив, что оно включало «несанкционированный доступ к ограниченному набору внутренних наборов данных и к нескольким учётным данным, используемым нашими сервисами». Платформа-распорядитель данных ИИ сообщила, что использовала собственный анализ на основе LLM для выявления «роя десятков тысяч автоматизированных действий» из «фреймворка автономных агентов». Этот агентный рой использовал уязвимость в конвейере обработки данных Hugging Face, чтобы получить возможность выполнять код в качестве рабочего процесса обработки, в конечном итоге повысив свои привилегии до высокоуровневого доступа к облачным и серверным кластерам компании.

На тот момент Hugging Face заявила, что LLM, использовавшаяся в атаке, «всё ещё не была известна». Однако OpenAI взяла на себя ответственность за вторжение вечером во вторник, сообщив, что оно произошло в ходе внутреннего тестирования с участием недавно выпущенной GPT-5.6 Sol и «ещё более мощной предрелизной модели». Модели тестировались на бенчмарке ExploitGym, независимом наборе тестов, основанном на сотнях реальных уязвимостей безопасности.

Хотя OpenAI заявила, что тесты бенчмарка выполнялись «в высокоизолированной среде», её агенты всё же имели доступ к «внутренне размещённому стороннему ПО» для установки необходимых реестров пакетов. Работая над бенчмарком ExploitGym в течение выходных, OpenAI сообщает, что агент «потратил значительное количество вычислительных ресурсов на вывод, чтобы найти способ получить доступ к открытому Интернету», в конечном итоге обнаружив его через zero-day уязвимость в кэш-прокси реестра пакетов.

Получив такой более широкий доступ в Интернет, OpenAI заявляет, что агент «предположил, что Hugging Face потенциально размещает модели, наборы данных и решения для ExploitGym», что привело к ранее раскрытой атаке на серверы. OpenAI сообщает, что её команда безопасности «обнаружила эту аномальную активность внутренне», независимо от собственного обнаружения Hugging Face.

,

Никакая клетка меня не удержит

Хотя OpenAI описала инцидент с Hugging Face как «беспрецедентный», компания также признала в отдельном сообщении в блоге на этой неделе, что ранее наблюдала, как недавние «модели длительного горизонта» — те, которые могут действовать автономно в течение длительного времени — предпринимали «нежелательные действия» для достижения целей тестирования, включая «поиск способов действовать за пределами своей песочницы».

Компания описала более ранний тест на бенчмарке NanoGPT speedrun, где модели было дано указание только опубликовать свои результаты во внутреннем Slack. Вместо этого модель решила следовать противоречащей директиве в инструкциях бенчмарка и опубликовать результаты публично на GitHub.

OpenAI заявляет, что её AI-агент сбежал из тестовой песочницы, чтобы взломать Hugging Face
Прямой эфир: модель длительного горизонта часами обдумывает сложную проблему кибербезопасности. Credit: Getty Images

Пытаясь выполнить эту инструкцию, OpenAI сообщает, что модель потратила час на поиск способов обойти ограничения песочницы, предназначенные для блокировки внешнего доступа в Интернет. Такая «настойчивость», продемонстрированная моделями длительного горизонта, отличается от действий более ранних моделей, которые, как правило, сдавались или искали разъяснений у пользователя, сталкиваясь с подобными дилеммами, заявили в OpenAI.

Подобные инциденты побудили OpenAI внедрить новые меры защиты, ориентированные на модели длительного горизонта, включая систему «активного мониторинга», предназначенную для отслеживания полной траектории действий агента, а не отдельных шагов. Но OpenAI заявляет, что такие меры защиты «намеренно не были включены» во время инцидента с Hugging Face, поскольку бенчмарк был «направлен на тестирование киберуязвимостей».

Новый вид угрозы

Любой, кто знаком с научно-фантастическими тропами о сдерживании ИИ, может быть, по меньшей мере, немного встревожен ярким реальным примером того, как модель ИИ использует уязвимости безопасности для получения запрещённого доступа в Интернет в достижении своих целей. Конгрессмен Грег Касар (демократ от Техаса) назвал этот инцидент «чрезвычайно тревожным» в заявлении в социальных сетях и призвал к «регулярному обязательному независимому тестированию безопасности и надзору, обязательному раскрытию инцидентов безопасности и международному сотрудничеству, чтобы уберечь людей от абсолютной катастрофы».

Инцидент с Hugging Face также повысил актуальность философских и практических дебатов о так называемом выравнивании ИИ и текущих усилиях по обеспечению соответствия действий модели ИИ намерениям её создателей-людей. В своём сообщении в блоге о безопасности ранее на этой неделе OpenAI заявила, что предприняла шаги для обеспечения того, чтобы модели длительного горизонта «запоминали инструкции при длительных развёртываниях», что помогло значительно сократить количество «несогласованных» результатов в тестировании.

,

OpenAI заявляет, что её AI-агент сбежал из тестовой песочницы, чтобы взломать Hugging Face
Новые меры защиты, ориентированные на «активный мониторинг» и «улучшенное выравнивание», помогли резко сократить непреднамеренные действия моделей, заявили в OpenAI. Credit: OpenAI

«Если это не убедит вас в том, что риски невыравнивания станут ключевой проблемой в будущем, я не знаю, что убедит», — написал в социальных сетях исследователь безопасности OpenAI Мика Кэрролл в связи с инцидентом.

Это далеко не первый случай, когда модель ИИ идёт на многое, чтобы найти непредусмотренные способы прохождения бенчмарка. В отчёте, опубликованном на этой неделе, Институт безопасности ИИ Великобритании (AISI) отметил, что обнаружил попытки недавних моделей «сжульничать» при его кибероценках (т.е. использовать сокращения, обходные пути или непредусмотренные/запрещённые методы для поиска решения) в 8–14 процентах случаев — нижняя граница диапазона, которая может занижать некоторые необнаруженные попытки мошенничества.

Группа тестирования безопасности описала один инцидент, в котором модель, столкнувшись с неправильно настроенной и «неразрешимой» оценкой, попыталась получить доступ к собственной инфраструктуре оценки AISI, используя код, который она написала и разместила на неконтролируемом стороннем интернет-сервисе.

Вторжение в Hugging Face также происходит в момент, когда компании ИИ выпускают серьёзные предупреждения о возможностях кибератак своих новейших моделей, что побуждает правительства реагироватьприказами в сфере национальной безопасности, ограничивающими их развёртывание. Хотя некоторые скептики видят в таких заявлениях маркетинговую шумиху вокруг возможностей новейших моделей, независимыеоценки показывают, что недавние модели достигают целей проникновения, которые были невозможны для более ранних автономных систем.

OpenAI заявляет, что её AI-агент сбежал из тестовой песочницы, чтобы взломать Hugging Face
Недавние модели длительного горизонта продемонстрировали улучшенные возможности проникновения в некоторых из самых сложных оценок AISI. Credit: AISI

Сэм Альтман из OpenAI раскритиковал панические предупреждения о безопасности ИИ как «маркетинг, основанный на страхе» в интервью в апреле. Но в июне OpenAI отложила выпуск GPT-5.6 в ответ на опасения по поводу безопасности со стороны правительства США.

Пока эти дебаты разворачиваются в сферах ИИ и кибербезопасности, инцидент с Hugging Face может стать поворотным моментом в том, как специалисты по кибербезопасности подходят к угрозам на основе ИИ. «Автономный, управляемый ИИ инструментарий для атак больше не является теоретическим, — написала Hugging Face в своём раскрытии на прошлой неделе. — Он снижает стоимость проведения широкой, терпеливой, многоэтапной кампании и действует на машинной скорости. Защита онлайн-платформы теперь означает рассмотрение поверхности данных и моделей как первостепенной поверхности атаки и использование ИИ в обороне, чтобы не отставать».

«Это день первый для кибербезопасности в эпоху агентов, — написал в социальных сетях сегодня сооснователь и генеральный директор Hugging Face Клем Деланг. — Мы все учимся тому, что секретность — это не ответ, и что всем защитникам (а не только избранным) повсюду нужны более мощные модели без ограничений, особенно открытые!»

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: