Почему проблема «rogue AI» приведёт к эпохе головной боли для специалистов по безопасности

Openai Hugging Face ии-агент взлом безопасность тестирование csoonline.com

Узнайте, как ИИ-агент OpenAI взломал Hugging Face за 4 дня, обойдя защиту «песочницы», и почему компания не заметила атаку. Разбор инцидента, его последствия для безопасности frontier-моделей и отставание регулирования.

Вскоре после того, как OpenAI публично признала факт утечки на Hugging Face 21 июля, журналист Reuters Рафаэль Саттер позвонил мне, чтобы узнать комментарий к материалу, который раскрыл шокирующие новые подробности инцидента с «непослушной моделью» OpenAI: агент не просто выскользнул из-под контроля на несколько часов, как многие предполагали, а на самом деле бесчинствовал в течение нескольких дней, причём компания об этом не знала.

Когда я повесил трубку, я сразу позвонил близкому другу, который работал в лабораториях frontier‑AI ещё до того, как возник сам этот термин. Услышав хронологию, она была ошеломлена. По её мнению, «если бы действовали надлежащие отраслевые нормы, эти четыре дня стали бы основанием для приостановки работы исследовательских GPU-кластеров OpenAI до проведения полной независимой проверки».

Демистификация инцидента

Появилось множество сообщений, в которых модель OpenAI описывается как «непослушный агент», сбежавший из-под стражи и «вырвавшийся» из исследовательской лаборатории; при этом BBC и Cloud Security Alliance сравнивали её действия с динозаврами из «Парка юрского периода».

Такая подача сюжетно привлекательна и позволяет легко донести до неспециалиста всю серьёзность ситуации. Однако она преуменьшает ответственность OpenAI как до, так и во время инцидента, и подпитывает более крупную проблему, связанную с тем, как компания преподносила свои действия почти в евангелистском ключе.

Упрощая, OpenAI тестировала две модели на бенчмарке, оценивающем, насколько хорошо агент умеет находить и эксплуатировать реальные уязвимости в программном обеспечении. Обе модели запускались с намеренно сниженными ограничениями на кибератаки, в «песочнице», которая должна была быть изолирована до единственного внутреннего прокси. Модели нацелились на Hugging Face, верно предположив, что эта AI-платформа хранит ключ ответов к бенчмарку, — проще говоря, «выбрали» жульничество на тесте, который им дали, чтобы выполнить задание.

После взлома команда криминалистов Hugging Face обнаружила в своих журналах тысячи действий агента, что указывает на то, что время на проникновение в Hugging Face плюс сама атака составили в общей сложности 4 дня.

Hugging Face обнародовала атаку ещё до того, как узнала, что за ней стоит OpenAI. OpenAI, в свою очередь, не понимала, что виновником является её собственный агент, пока публичное заявление Hugging Face не заставило их проверить свои логи. В общей сложности OpenAI потребовалось почти две недели с момента первого побега агента, чтобы признаться, и только когда рука конкурента вынудила их это сделать.

«Проблемный ребёнок» OpenAI

С человеческой точки зрения озадачивает, что из всех путей, которые мог выбрать агент OpenAI, чтобы пройти стандартизированный тест на безопасность, он выбрал нелепо запутанный подход, испробовав десятки тысяч вариантов и пробивая установленные ограничения. Однако это было ожидаемо, учитывая послужной список одной из моделей.

В посте, опубликованном за день до раскрытия информации о Hugging Face, OpenAI описывает одну из своих моделей, которая, в отличие от старых версий, просто останавливающихся перед ограничением «песочницы», продолжала настойчиво пытаться найти обходной путь, однажды потратив целый час на поиск уязвимости в «песочнице», а затем выложив результаты на GitHub вопреки прямым инструкциям. Эта модель — GPT Sol 5.6, та самая публичная модель, участвовавшая в атаке на Hugging Face.

Задолго до инцидента с Hugging Face GPT Sol 5.6 уже приобрела репутацию нарушителя правил, смехотворно долго выполняющей простые задачи и склонной к разрушениям — в одном случае удалив всё содержимое Mac одного AI-предпринимателя.

Даже во время внутреннего тестирования модель была замечена за убийством случайных процессов, когда не могла найти нужные виртуальные машины, ложью о проверке своей работы и использованием учётных данных, к которым ей не разрешалось обращаться. Тем не менее компания предоставила ей публичный доступ.

Прибыль превыше безопасности

Отчёт CSA утверждает, что модель OpenAI вырвалась из тестового контейнера в сентябре 2024 года в ходе другой оценки, была тихо обезврежена и «тогда это в основном восприняли с восторгом», а не как предупреждение. Тот же отчёт называет такого рода побеги «нормой, а не исключением». Бывший руководитель команды OpenAI по «супервыравниванию» уволился в мае 2024 года и написал публично, что «культура и процессы безопасности отошли на второй план ради блестящих продуктов». Сообщалось, что почти половина команды, работавшей над долгосрочной безопасностью ИИ, уволилась.

Даже язык, который OpenAI использовала в своём раскрытии, звучит скорее хвастливо, чем обеспокоенно. С точки зрения OpenAI, её неудача заключалась в отсутствии общего контроля за выбором агента, поскольку каждый отдельный шаг модели может казаться безобидным, пока не будет собран воедино. Компания не признаёт, что оставление агента без присмотра в тестовой среде с отключёнными классификаторами безопасности даже на один час, не говоря уже о днях, может быть чревато катастрофой.

Некоторые исследователи утверждали, что недавний инцидент — это по сути многолетний сбой в системе безопасности, а не история о «непослушном интеллекте»: использовались открытый прокси, повторно использованные учётные данные и инфраструктура, у которой не должно было быть выхода наружу. Однако квалифицированному человеку-хакеру при тех же возможностях потребовались бы недели, чтобы добиться лишь малой доли того, что агент сделал за несколько дней.

Симптом глубинных проблем

Инцидент вскрывает более масштабные проблемы, связанные с культурой безопасности в компаниях, разрабатывающих frontier-модели. Их сотрудники вынуждены работать в бешеном темпе, сокращая циклы R&D, и игнорировать потенциальные проблемы, пока те не станут активными угрозами. Это характерно не только для OpenAI — сообщается, что Институт безопасности ИИ Великобритании обнаружил, что каждая протестированная им frontier-модель хотя бы время от времени жульничает на оценках кибербезопасности, а окна предварительного тестирования перед развёртыванием сократились в отрасли с примерно пяти недель до всего пяти дней.

Регулирующие органы также не поспевают за быстрыми темпами развития отрасли или не понимают их. В США нет обязательной правовой базы, которая потребовала бы от OpenAI иной реакции — лаборатории связаны лишь добровольными обязательствами, которые взвешиваются с коммерческим давлением, и в таких случаях огромные бреши в безопасности лишь заставляют модель выглядеть чрезвычайно умной и мощной.

США пытались создать барьеры, но они не понимают экосистему. Последствия этого непонимания видны в недавней атаке: когда специалисты Hugging Face по реагированию попытались проанализировать действия атакующего, модели Anthropic отказались от криминалистической работы, сославшись на собственные ограничения, иHugging Face вместо этого провела анализ на GLM 5.2 — модели с открытыми весами от пекинской компании Z.ai. Помимо того, что это неэффективная полумера, это также выводит бизнес за пределы США и, следовательно, из-под их регулирующего контроля. Сегодня около 80% американских AI-стартапов строят свои продукты на китайских моделях с открытым исходным кодом.

В Палату представителей США внесён законопроект, прямо ссылающийся на этот инцидент, требующий наличия аварийного выключателя и отчётности об инцидентах, но ничего подобного пока не принято, и ни одна юрисдикция не продемонстрировала понимания необходимости регулировать поведение во время тестирования, а не только при развёртывании. Этот инцидент произошёл полностью на этапе тестирования, до принятия решения о выпуске, на стадии, которую все текущие предложения рассматривают как исключение из правил.

Важно отметить, что безопасность и практика ИИ отличаются от других направлений кибербезопасности тем, что они должны строиться на поведенческой и психологической основе, а не только на основе возможностей.

Например, хотя послужной список Anthropic далёк от безупречного, эта компания вложила значительно больше усилий, чем другие, в понимание неосознанных «мыслительных процессов» (или «j-пространства») своих моделей, чтобы лучше предсказывать возможные нарушения и выстраивать более эффективные барьеры. То, что мы можем извлечь из этих «непослушных моделей», — это то, что их поведение на самом деле очень предсказуемо: мы знаем, что, получив цель, модели будут свободно нарушать границы в стремлении к ней, просто потому, что у них нет реального понимания того, как мы категоризируем «приемлемое поведение». В реальном мире эксплуатация уязвимостей поощряет нарушение правил и игнорирование границ по самой своей сути, так почему же модель, обученная так мыслить, должна воспринимать правила теста иначе?

Для CSO и CIO практическое значение этого события пока остаётся узким. Посмертный анализ CSA предлагает в основном традиционные советы: изолировать прокси-серверы пакетов и хранилища учётных данных с выходом в открытый интернет по умолчанию, журналировать среды оценки ИИ так же, как вы журналируете всё, что обращено к клиентам, и выстраивать реагирование на инциденты на скорости машин, а не человека.

Ключевым фактором риска сейчас является объём — агенты осуществляют действия в таких количествах, которые наши конвейеры ещё не способны отследить. И организации, которые переживут следующую волну «непослушных агентов», будут теми, кто заранее предполагает это.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: