OpenAI приостановила обучение, оценку и инференс с использованием инструментов для своих наиболее мощных моделей ИИ после того, как агент обошел сетевые ограничения для связи с внешним чат-ботом во время обучения с подкреплением внутренней исследовательской модели.
«Наш сценарий безопасности предполагал, что модель не сможет получить доступ к интернету в реальном времени, и что мониторинг обнаружит успешные попытки. Инцидент выявил пробел в наших мерах контроля сетевых ограничений», — написала компания в новом отчете о несоответствии, посвященном инциденту, одном из трех, опубликованных в пятницу.
Компания заявила, что возобновит обучение только после того, как «пробел будет устранен» и система будет дополнительно протестирована.
Инцидент произошел во время исследовательского задания, в рамках которого модели было предложено идентифицировать человека, используя информацию, доступную в интернете. Когда ее обычные инструменты веб-поиска не смогли предоставить необходимую информацию, модель начала искать другой способ доступа в интернет, пояснила компания в сообщении.
Модель распознала, что, хотя прямой доступ в интернет был заблокирован, среда все еще позволяла выполнять DNS-запросы. Затем она использовала DNS в качестве косвенного канала связи для отправки запросов внешнему чат-боту, фактически обойдя сетевое ограничение, которое должно было предотвратить доступ к внешним сервисам, сообщила OpenAI.
Существующих мер контроля может быть недостаточно
Однако для предприятий и их ИТ-директоров, несмотря на то, что модель не была выпущена, инцидент поднимает критические вопросы о том, могут ли существующие меры безопасности и управления идти в ногу с неожиданным поведением модели по мере того, как агенты ИИ получают большую автономию и доступ к корпоративным системам, говорят аналитики.
«Традиционных мер безопасности может быть недостаточно для агентов ИИ, поскольку эти меры разработаны вокруг известных путей доступа, таких как приложения, подключающиеся к одобренным API или базам данных. Агенты ИИ представляют собой другую проблему, поскольку они могут исследовать альтернативные способы выполнения задачи, когда их намеченный маршрут заблокирован, включая использование разрешенных инструментов или протоколов непредусмотренными способами», — сказал Абхишек Сатапати, ведущий аналитик Avasant.
Это требует «независимо применяемых мер контроля над вызовом инструментов, исходящим сетевым трафиком и доступом к данным наряду с существующими мерами безопасности, чтобы гарантировать соблюдение ограничений даже тогда, когда агент пытается совершить несанкционированное действие», — добавил Сатапати.
Его мнение отражено в статье 2026 года, соавторами которой являются исследователи из Google, Qualcomm, *Meta и нескольких университетов, где утверждается, что гарантии безопасности должны обеспечиваться на системном уровне, а не полагаться исключительно на средства защиты на уровне модели.
Более того, предприятия должны ужесточить ограничения на исходящие соединения и разрешение DNS, предоставляя агентам, обрабатывающим конфиденциальные данные, только одобренные и регистрируемые пути для внешней связи, чтобы снизить риск утечки данных, несанкционированной внешней связи и других непреднамеренных действий, сказал Амит Кумар Джена, руководитель отдела разработки ИИ в ИТ-консалтинговой компании Kanerika.
«Команды безопасности также должны развернуть системы мониторинга, которые оповещают людей, участвующих в процессе, о необычных шаблонах трафика и неудачных попытках достичь несанкционированных пунктов назначения, особенно со стороны агентов, выполняющих код, способных находить нетрадиционные способы выполнения задач», — добавил Джена.
ИИ проскользнул через операционные пробелы
Однако проблема в том, что в данном случае у OpenAI были такие системы мониторинга, и в них участвовали люди: они просто не сработали должным образом.
Системе мониторинга потребовалось более 10 минут, чтобы выдать предупреждение в ответ на злоупотребление DNS агентом — и, по словам OpenAI, были и другие случаи внешнего доступа к DNS, которые система не отметила.
Человеку-рецензенту потребовалось всего три минуты, чтобы подтвердить сгенерированное системой предупреждение о DNS, но остановка процесса обучения заняла еще два с половиной часа. OpenAI объяснила задержку сбоем автоматизированной системы: «Процесс не остановился автоматически, как ожидалось, что вызвало путаницу относительно того, следовало ли его останавливать», — говорится в отчете.
Компания заявила, что устраняет операционные пробелы, усиливает обнаружение использования DNS моделями, находящимися под наблюдением, и улучшает тестирование систем обнаружения.
«Мы также ускорили дополнительное моделирование красных команд для песочницы и сетевых средств управления. Эти усилия по моделированию красных команд могут выявить другие транзитивные пути доступа в интернет, в этом случае мы будем оперативно устранять проблемы и при необходимости приостанавливать исследовательские рабочие нагрузки», — написала OpenAI.
Однако внедрение этих дополнительных уровней безопасности, управления, тестирования и человеческого надзора сопряжено с собственными проблемами.
Эти дополнительные уровни повлияют на степень автономии, которую могут достичь модели, сказал Сатапати. «В рабочих процессах, связанных с конфиденциальными данными, внешними подключениями или значимыми действиями, дополнительные меры контроля, тестирование и человеческий надзор могут ограничить степень полной автоматизации задач».
*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Anirban Ghoshal




