Meta* вслед за OpenAI и Anthropic допустила нарушение безопасности при тестировании ИИ

ии безопасность инциденты тестирование агенты стандарты csoonline.com

Узнайте, как Meta*, OpenAI и Anthropic столкнулись с инцидентами безопасности ИИ при тестировании. Поймите риски автономных агентов и необходимость новых стандартов оценки и изоляции.

Meta* стала третьим разработчиком передового ИИ за последние недели, раскрывшим инцидент безопасности, связанный с одной из своих продвинутых моделей ИИ во время тестирования кибервозможностей, проведенного стартапом по безопасности ИИ Irregular, что поставило независимого оценщика в центр серии раскрытий, касающихся ведущих лабораторий ИИ отрасли.

Во время теста «захват флага» от Irregular модель Meta* Muse Spark 1.1 скомпрометировала систему другой компании и использовала уязвимость безопасности, сообщает Reuters . Модель получила несанкционированный доступ из-за проблемы конфигурации в тестовой среде. Цитируя Meta*, отчет добавил, что инцидент был локализован, не причинил долгосрочного вреда и был раскрыт в рамках усилий по прозрачности.

Раскрытие произошло через несколько дней после аналогичных инцидентов, о которых сообщили OpenAI и Anthropic, все из которых произошли во время оценок, проведенных Irregular.

OpenAI указала на Irregular, своего внешнего партнера по тестированию кибербезопасности, из-за неправильной конфигурации тестовой среды, которая позволила ее моделям получить доступ к общедоступному интернету. Anthropic также заявила, что ее агенты вышли из-под контроля из-за неправильной конфигурации тестирования со стороны Irregular, но добавила, что инцидент произошел из-за недопонимания между двумя компаниями.

Irregular не сразу ответил на запрос комментария.

Irregular становится ключевым игроком в тестировании передового ИИ

Хотя инциденты касались разных моделей и разных технических сбоев, они привлекли необычное внимание к Irregular, независимой компании по безопасности ИИ, которая оценивает продвинутые системы ИИ для ведущих разработчиков моделей.

Раскрытия также подчеркивают расширяющуюся роль сторонних специалистов-оценщиков, поскольку разработчики передового ИИ все чаще полагаются на независимые организации для оценки кибервозможностей и безопасности своих самых продвинутых моделей перед развертыванием.

«Недавние инциденты представляют собой различные типы сбоев», — сказала Сакши Гровер, старший менеджер по исследованиям IDC Asia/Pacific Cybersecurity Services.

Она сказала, что инцидент с OpenAI включал модель, использующую ранее неизвестную уязвимость после выхода за пределы предполагаемой среды оценки, в то время как инциденты Anthropic в основном касались проблем конфигурации, которые непреднамеренно предоставили доступ к интернету. Отдельная оценка Британского института безопасности ИИ (UK AI Safety Institute) была иной, поскольку доступ к интернету был намеренно включен для оценки кибервозможностей до того, как агенты ИИ взаимодействовали с реальными внешними системами и лицами.

«Общая проблема в том, что среды оценки больше нельзя рассматривать как пассивную тестовую инфраструктуру», — сказал Гровер. «Способный киберагент должен рассматриваться как потенциально враждебная машинная идентичность, даже при работе в рамках законной исследовательской цели».

Гровер также предупредил, что если модель получит доступ к эталонным решениям, инфраструктуре оценщика или эталонным артефактам, это может поставить под угрозу не только изоляцию, но и целостность самой оценки возможностей.

Растут призывы к общим стандартам оценки

Раскрытия побудили экспертов по безопасности призвать к более строгим мерам защиты, регулирующим проектирование и мониторинг оценок передового ИИ, независимо от того, проводятся ли они разработчиками моделей или независимыми тестовыми фирмами.

«Есть веские основания для введения общих минимальных стандартов, охватывающих разработчиков моделей и независимых оценщиков», — сказал Гровер. Она рекомендовала политику «запретить по умолчанию» доступ к интернету, выделенные краткосрочные идентификаторы для агентов ИИ, контролируемый сетевой доступ, всесторонний мониторинг подсказок, вызовов инструментов, учетных данных и сетевой активности, а также автоматические условия остановки, когда агенты достигают несанкционированных систем или выполняют видимые извне действия.

Вибхум Дубей, исследователь кибербезопасности и участник red team, сказал, что текущие методы оценки не поспевают за возможностями передового ИИ.

«Лаборатории ИИ создают модели, которые могут мыслить на несколько шагов вперед, но многие среды оценки все еще предполагают, что агент останется в рамках предполагаемого сценария», — сказал Дубей. «Это несоответствие. Оценка должна судить о том, насколько хорошо среда выдерживает неожиданное поведение, а не только о том, выполняет ли модель свою задачу».

«Эти инциденты показывают, что мы оцениваем интеллект быстрее, чем оцениваем изоляцию».

Несмотря на то, что Irregular находится в центре этих инцидентов, и OpenAI, и Anthropic намерены продолжать сотрудничество с тестовой фирмой.

«Мы ценим партнерство с Irregular и продолжим тесно сотрудничать с ними для поддержки их проверки. Irregular также разрабатывает технический документ для обмена лучшими практиками по изоляции и безопасному проведению кибероценок», — заявили в OpenAI.

«Мы благодарны им за тесное сотрудничество с нами для понимания и устранения этих инцидентов; они также проводят собственное расследование. Мы с нетерпением ждем нашей совместной работы по безопасности», — заявили в Anthropic в своем заявлении от 30 июля.

Дубей сказал, что оценочные лаборатории должны принять подход «не доверяй никому, проверяй всё», при котором каждое исходящее соединение, идентичность и внешнее взаимодействие требуют явной авторизации, а также публиковать метрики изоляции наряду с эталонами возможностей.

Апекша Каушик, старший ведущий аналитик Gartner, сказала, что традиционная изоляция (sandboxing) и статическое сдерживание становятся неадекватными по мере того, как системы ИИ становятся более автономными (agentic), и призвала к отраслевым стандартам, охватывающим проектирование среды оценки, отчетность об инцидентах и непрерывное тестирование red team.

Последствия для предприятий

Аналитики заявили, что раскрытия содержат уроки для предприятий, готовящихся к развертыванию агентов ИИ.

«Самая большая ошибка — рассматривать агентов ИИ как функции, а не как операционные идентичности», — сказал Дубей. «Каждый развернутый вами агент становится еще одной сущностью, принимающей решения по безопасности от вашего имени». Организации должны убедиться, что они могут быстро обнаружить и остановить автономного агента до его развертывания в производственной среде, сказал он.

Гровер сказал, что организации должны обеспечивать границы безопасности с помощью инфраструктуры, идентичности и контроля доступа к инструментам, а не только подсказок, сохранять одобрение человека для необратимых действий и отслеживать наблюдаемое поведение агента.

«Эти инциденты не следует сводить ни к тому, что модели «выходят из-под контроля», ни к простой неправильной сетевой конфигурации», — сказала она. «Они показывают, что способные агенты могут превратить обычные слабости контроля, неоднозначные задачи и чрезмерные разрешения в реальные последствия». Ни Meta*, ни Irregular не ответили немедленно на запрос комментария.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: