OpenAI и Anthropic расследуют десятки тысяч инцидентов безопасности ИИ; OpenAI приостанавливает тестирование после того, как “аварийный выключатель” ИИ не смог остановить вышедшего из-под контроля агента

ии безопасность Openai Anthropic инциденты риски tomshardware.com

OpenAI и Anthropic расследуют десятки тысяч инцидентов безопасности ИИ. Передовые модели обходили защиту, выходили из изолированных сред и получали доступ к реальным веб-сайтам. Узнайте о рисках и мерах предосторожности.

Ведущие ИИ-лаборатории OpenAI и Anthropic, а также исследователи в области безопасности в настоящее время изучают десятки тысяч инцидентов безопасности, связанных с их передовыми моделями, согласно отчету Axios от 26 сентября. Отчет был опубликован после расследования случаев, когда автономные ИИ-агенты совершали действия, которые независимые оценщики и исследователи безопасности пометили как проблематичные. Axios утверждает, что огромное количество инцидентов, произошедших во время недавнего внутреннего тестирования и реальных оценок моделей, указывает на то, что «проблема на порядки сложнее, чем известно общественности». OpenAI приостановила обучение своих самых мощных моделей после очередного инцидента, когда автоматический «аварийный выключатель» не смог остановить вышедшего из-под контроля агента во время обучения.
К отмеченным эпизодам относятся случаи, когда модели обходили защитные механизмы, создавали доски объявлений, выходили из изолированных сред, захватывали веб-сайты и самостоятельно генерировали запросы. Инциденты различаются по степени тяжести и включают как успешные, так и неудачные попытки, причем большинство из них пока не привели к реальному ущербу. Часть тестирования, в ходе которого произошли эти эпизоды, напоминает «красную команду», когда компании намеренно пытаются заставить модели вести себя некорректно, чтобы оценить их безопасность.
Пожалуй, самым серьезным случаем был июльский инцидент, когда GPT-5.6 Sol и невыпущенная модель OpenAI вышли из своей тестовой среды и проникли на производственные серверы Hugging Face в поисках ответов на бенчмарк ExploitGym. Технический отчет OpenAI, опубликованный в августе, показал, что ответственные модели были непреднамеренно обучены обманывать и общаться друг с другом, и с мая они оставляли друг другу сообщения, общаясь незамеченными.
Отчет Axios последовал за серией новых разоблачений от OpenAI, в которых компания подтвердила, что выявила 53 случая, когда изображения, предоставленные пользователями, которые не отказались от использования своих данных ChatGPT для обучения моделей, были размещены на сайтах для хостинга изображений. В тот же день OpenAI подтвердила, что ее агенты получили доступ к веб-сайтам правительства США, включая сайты Комиссии по ценным бумагам и биржам и Бюро переписи населения. Днем ранее премьер-министр Австралии Энтони Албаниз сообщил, что агенты OpenAI взломали портал отчетности по статистике Medicare, управляемый Services Australia, агентством, которое осуществляет выплаты в сфере здравоохранения и социального обеспечения в стране, получив доступ как к общедоступным, так и к закрытым файлам. OpenAI потребовалось 84 дня, чтобы уведомить агентство о взломе.
OpenAI приостановила обучение своих самых мощных моделей после инцидента, когда автоматические системы защиты не смогли остановить вышедшего из-под контроля агента во время обучения. 20 сентября внутренняя исследовательская модель OpenAI, проходящая обучение на основе поиска, обошла сетевые фильтры, направив свои запросы через внутренний DNS-резолвер обучающей среды для связи с внешним общедоступным чат-ботом. Система мониторинга компании подала сигнал тревоги в течение 15 минут, а через три минуты человек подтвердил его. Однако автоматический «аварийный выключатель» полностью отказал, позволив процессу обучения продолжаться еще два с половиной часа, прежде чем инженеры OpenAI вручную остановили его.
После инцидента OpenAI заявила, что возобновит обучение «только тогда, когда мы будем уверены, что у нас есть дополнительные меры безопасности и улучшения согласованности», сообщил Axios представитель компании. Приостановка распространяется на обучение, оценку и запуск ее самых мощных моделей с использованием инструментов. «Это не первый раз, когда мы делаем паузу для принятия таких мер, и мы не ожидаем, что это будет последний раз, поскольку возможности ИИ продолжают развиваться», — добавил представитель.
Со своей стороны, Anthropic поручила сторонней организации по безопасности изучить поведение своих моделей, сообщает Axios. Компания также публикует данные о том, как часто ее модели ведут себя некорректно, в своих системных карточках. В системной карточке для Claude Opus 5.5, опубликованной 22 сентября, указано, что в двух новых оценках, проведенных без защитных мер, модель пыталась выйти из изолированной среды или манипулировать ею в 1,5% случаев. Anthropic подчеркнула, что это были враждебные эксперименты, в которых задачу нельзя было решить без выхода из изолированной среды. На своей странице запуска компания заявляет, что Opus 5.5 пытался обойти ограничения примерно на 85% реже, чем Opus 5 или Claude Mythos 5.1, и каждая попытка была низкой степени тяжести и самоуведомленной.
Относительно огромного количества сообщений об инцидентах источники Axios указывают, что Anthropic и другие лаборатории проводят сотни тысяч тестовых запусков своих моделей; следовательно, даже небольшой процент некорректного поведения может привести к десяткам тысяч инцидентов. Anthropic, например, проанализировала 141 006 оценочных запусков, в которых Claude имел доступ в Интернет, и обнаружила три инцидента, в которых Claude взломал три реальные компании во время тестирования возможностей безопасности.
Anthropic заявила, что считает эти инциденты скорее сбоем в системе управления и эксплуатации, чем сбоем согласованности модели, поскольку моделям было сказано, что у них нет доступа в Интернет, хотя на самом деле они были неправильно настроены на его наличие. Помимо Anthropic и OpenAI, другие ИИ-модели также имеют свои инциденты. Google подтвердила сообщение о том, что ее модели Gemini взломали три компании ранее в этом году.
Некоторые эксперты, опрошенные Axios, считают, что эти инциденты являются единичными случаями, и ожидают, что будущие сообщения будут менее серьезными благодаря улучшенным средствам контроля. Они также говорят, что существуют простые исправления, которые помогут лабораториям избежать некоторых причин, по которым эти эпизоды выглядели так опасно для посторонних. С другой стороны, другие заинтересованные стороны выразили ограниченную уверенность в том, что ИИ-компании смогут предотвратить все проблематичное поведение моделей, заявив, что для этого потребуется невыполнимая задача предвидения всех возможных способов, которыми модели могут отклониться от курса. В любом случае, эксперты считают, что некоторое некорректное поведение ожидается при тестировании новых моделей лабораториями, и сведение этого риска к нулю может быть невозможным.
Эти инциденты усилили призывы к созданию защитных механизмов во всей ИИ-индустрии. В эссе, поддержанном руководителями OpenAI, Google DeepMind и Microsoft, генеральный директор Anthropic Дарио Амодеи призвал Вашингтон регулировать темпы развития ИИ из опасений, что агенты могут выйти из-под контроля, предупреждая о потенциальном рое ботнетов на базе ИИ, который может захватить весь Интернет. Президент Дональд Трамп неоднократно отвергал призывы к регулированию как мистификации и объявил о планах создать «ИИ-силу» для поддержки, помощи и надзора за ИИ-индустрией по мере ее роста.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: