Побег модели OpenAI заставляет пересмотреть защиту корпоративных ИИ

Openai Hugging Face ии-безопасность изоляция Zero-Day кибератака csoonline.com

Узнайте, как ИИ-модели OpenAI сбежали из изолированной среды и атаковали Hugging Face. Поймите, почему защита промптов не работает, и какие меры изоляции необходимы предприятиям для защиты от подобных инцидентов.

Компания OpenAI признала, что в ходе неудачной оценки кибербезопасности некоторые из её самых мощных ИИ-моделей объединились, чтобы сбежать из изолированной среды (sandbox) и атаковать системы Hugging Face. Тестируемые модели были модифицированы, чтобы позволить им выполнять потенциально опасные действия, от которых отказались бы производственные версии. Инцидент подчёркивает: если защитные ограждения промптов ИИ выходят из строя или, как в данном случае, удалены, предприятия должны иметь надёжную изоляцию или другие технические ограничения для защиты систем.

В ходе оценки OpenAI модели GPT-5.6 Sol и более мощная предрелизная модель соревновались в решении задач кибербезопасности в ExploitGym — инструменте для бенчмаркинга кибербезопасности. Они пришли к выводу, что ответы могут находиться в системах Hugging Face, и приступили к получению доступа, написала OpenAI в блог-посте об атаке на Hugging Face.

ExploitGym ставит перед ИИ-моделями задачу превратить уязвимости безопасности в эксплойты. OpenAI предоставила своим моделям ограниченный доступ в интернет через прокси-сервер реестра пакетов для загрузки кода, необходимого для построения атак. Однако модели использовали zero-day-уязвимость в прокси для получения неограниченного доступа в интернет, а затем с помощью украденных учётных данных и других недостатков проникли в системы Hugging Face.

Для CIO и CISO проблема выходит за рамки исследований в области кибербезопасности. ИИ-агенты, подключённые к корпоративным базам данных, репозиториям исходного кода или платёжным системам, могут раскрыть конфиденциальные ресурсы, если контроль доступа и изоляция не будут работать, когда защита на уровне модели выходит из строя.

«Защитные ограждения промптов — это не средства безопасности, — сказал Бисваджит Махапатра, ведущий аналитик Forrester. — Это поведенческие ограничения, которые могут выйти из строя, быть обойдены или намеренно отключены во время тестирования».

Как изоляция была нарушена

Несмотря на ослабленные меры защиты модели, окружающая инфраструктура должна была сдерживать активность. Сетевой доступ был ограничен внутренним сторонним сервисом, который выступал в качестве прокси и кэша для реестров программных пакетов. Такие прокси обычно используются на предприятиях для защиты от атак на цепочки поставок ПО, исходящих извне.

OpenAI сообщила, что модели обнаружили zero-day-уязвимость в этом сервисе, использовали её, выполнили повышение привилегий и латеральное перемещение, пока не достигли узла с открытым доступом в интернет.

Оказавшись в сети, модели предположили, что Hugging Face может хранить модели, наборы данных или решения, связанные с ExploitGym. OpenAI заявила, что в одном из путей атаки модели объединили украденные учётные данные с zero-day-уязвимостями для получения удалённого выполнения кода на серверах Hugging Face.

В своём отчёте о действиях на своей инфраструктуре Hugging Face сообщила, что вредоносный набор данных злоупотребил двумя путями выполнения кода в конвейере обработки данных. Затем злоумышленник получил доступ на уровне узла, собрал облачные и кластерные учётные данные и переместился в несколько внутренних кластеров.

OpenAI заявила, что в итоге модели получили тестовые решения ExploitGym напрямую из производственной базы данных Hugging Face. Модели оставались сосредоточенными на решении бенчмарка, несмотря на то, на какие ухищрения они пошли для достижения этой цели, говорится в сообщении.

Санчит Вир Гогиа, главный аналитик Greyhound Research, отметил, что прокси-сервер реестра пакетов должен вызывать беспокойство у команд безопасности предприятий, поскольку это было узко разрешённое исключение в иначе ограниченной среде.

«Каждое корпоративное хозяйство построено на исключениях именно такого рода», — сказал он.

В этом инциденте модели OpenAI выполняли задуманное — пусть и непредусмотренными средствами, — но предприятиям следует позаботиться о том, чтобы их собственные ИИ-системы оставались в рамках поставленных задач.

Махапатра заявил, что предприятия должны относиться к ИИ-агентам как к «высокорисковым нечеловеческим идентичностям», помещая каждого в изолированную среду, где доступ ограничен назначенной задачей, а учётные данные быстро истекают.

«Приемлемый радиус поражения означает, что скомпрометированный агент может затронуть только один рабочий процесс, набор данных или приложение, а не открыть путь в более широкую корпоративную инфраструктуру», — сказал Махапатра.

А Гогиа предупредил, что сервисы, которым разрешено обращаться к реестрам пакетов, системам обновлений или другим внешним ресурсам, могут стать путями для побега, если они не подвергаются такому же контролю, как и сам агент.

Защита, необходимая предприятиям

Hugging Face сообщила, что вторжение привело к несанкционированному доступу к ограниченному числу внутренних наборов данных и нескольким учётным данным, используемым её сервисами. Не было обнаружено никаких доказательств того, что публичные модели, наборы данных или Spaces были изменены, и компания заявила, что её опубликованные программные пакеты и образы контейнеров не были скомпрометированы.

Компания закрыла пути выполнения кода, использованные для получения доступа, и перестроила затронутые узлы. Она также отозвала раскрытые учётные данные и ужесточила правила, регулирующие рабочие нагрузки, допускаемые в её кластеры.

Независимо от того, удерживают ли они свои ИИ-системы внутри или не допускают проникновения вредоносных ИИ извне, Гогиа сказал, что предприятиям следует проверять, работают ли их границы изоляции, а не полагаться на архитектурные диаграммы или заявленные политики. Такие тесты должны пытаться получить учётные данные, пересечь границы доверия и достичь систем, выходящих за рамки назначенной агенту задачи.

Махапатра заявил, что предприятиям следует исходить из того, что один уровень изоляции может выйти из строя, и гарантировать, что доступ агента не сможет обеспечить путь к несвязанным приложениям или более широкой корпоративной инфраструктуре.

OpenAI сообщила, что всё ещё расследует инцидент вместе с Hugging Face и вводит более строгие конфигурации в своей исследовательской среде, пока устраняются уязвимости, даже если это замедлит исследования. Компания также усиливает изоляцию и мониторинг в ходе будущих оценок.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: