Hugging Face на прошлой неделе сообщила об атаке. OpenAI теперь заявляет, что её совершила невыпущенная модель компании.

кибератака ии Openai Hugging Face уязвимость безопасность gizmodo.com

ИИ-модели OpenAI, включая GPT-5.6 Sol, взломали Hugging Face в ходе вышедшего из-под контроля теста. Узнайте, как автономные агенты нашли уязвимости нулевого дня и украли данные, и что это значит для кибербезопасности.

В блоге от четверга прошлой недели репозиторий ИИ-моделей Hugging Face сообщил о необычной кибератаке на системы, обеспечивающие работу его сервисов. «Этот случай отличался от всего, с чем мы сталкивались раньше», — говорится в сообщении, — «потому что он был полностью управляем автономной системой ИИ-агентов».

В своем блоге во вторник OpenAI заявила, что виновниками атаки стали ее собственные модели, и координирует действия с Hugging Face для урегулирования ситуации.

OpenAI теперь утверждает, что атака была «спровоцирована» ИИ-моделями, которые проходили внутреннюю оценку в OpenAI, включая флагманскую модель GPT-5.6 Sol, а также вторую нераскрытую модель, которая еще не была выпущена или анонсирована. «Мы считаем этот инцидент беспрецедентным киберинцидентом, связанным с использованием передовых кибервозможностей, и реагируем соответствующим образом», — написала OpenAI.

В формулировках своего отчета OpenAI приписывает действие модели или моделям, а не отдельному агенту, работающему на модели. Axios в своем изложении этой истории сообщает: «Модели были автономными токенмаксерами».

По сути, в блоге OpenAI говорится, что проводилась оценка, предназначенная для проверки способности моделей осуществлять кибератаки — так называемые бенчмарки. Эти экземпляры моделей работали теоретически без доступа в интернет, имея возможность загружать данные только из сети, размещенной самой OpenAI через неназванного веб-хостинг-провайдера.

Используемым бенчмарком, по-видимому, был ExploitGym, который не является собственным тестом OpenAI. Команда, создавшая его, связана с Калифорнийским университетом в Беркли, Институтом безопасности и конфиденциальности Макса Планка, Калифорнийским университетом в Санта-Барбаре, Университетом штата Аризона, Anthropic, OpenAI и Google. Насколько я могу судить, все это размещено на GitHub.

Но, по-видимому, модели одержимо стремились улучшить свои результаты в ExploitGym, и вот что произошло:

«Работая в нашей изолированной тестовой среде, наши модели потратили значительное количество вычислительных ресурсов на поиск способа получения открытого доступа в интернет, стремясь решить задачу оценки. Чтобы получить доступ, модели выявили и использовали уязвимость нулевого дня (о которой мы теперь ответственно сообщили поставщику) в прокси-сервере кэша реестра пакетов. Получив этот доступ, наши модели выполнили ряд действий по повышению привилегий и боковому перемещению в нашей исследовательской тестовой среде, пока не достигли узла с доступом в интернет».

Оказавшись в сети, они «предположили», что ответы на тест можно извлечь из Hugging Face, что правдоподобно, поскольку там размещено множество ИИ-моделей и других связанных инструментов. Этот недобросовестный оператор «искал и успешно нашел способы получить доступ к секретной информации, которую можно было использовать для обмана оценки». По-видимому, это включало получение украденных учетных данных и выявление уязвимостей нулевого дня для поиска решений ExploitGym где-то на серверах Hugging Face.

Команды безопасности внутри OpenAI и Hugging Face, по-видимому, заметили происходящее. Теперь они заявляют, что объединили свои расследования.

Пост в блоге Hugging Face от прошлой недели, похоже, был опубликован до этой координации. Фактически, он был опубликован до того, как OpenAI выступила в качестве компании, стоящей за виновником. «Мы не знаем, какая модель управляла агентами атакующего — взломанная хостинговая модель или неограниченная модель с открытым весом», — написала Hugging Face, добавив: «В любом случае, атакующий не был связан никакой политикой использования, в то время как нашу собственную криминалистическую работу блокировали ограничения хостинговых моделей, которые мы сначала попробовали».

Еще в апреле Anthropic объявила, что ее беспрецедентно мощная модель Mythos «может изменить кибербезопасность», запустив Project Glasswing — координационные усилия по подготовке организаций к будущим угрозам кибербезопасности. Аналогично, OpenAI в своем блоге об этом инциденте заявляет, что организации могут подать заявку на получение расширенной информации о безопасности через программу доверенного доступа. «Мы призываем других защитников подать заявку на доверенный доступ и экспериментировать с этими моделями сейчас, чтобы преобразовать эти возможности в более эффективное предотвращение, более быстрое обнаружение и более результативное реагирование на инциденты», — говорит OpenAI.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: