Агент OpenAI выходит из-под контроля и взламывает популярное ИИ-сообщество

Openai ии-агент взлом кибербезопасность автономный ии Hugging Face tomshardware.com

Выясните, почему OpenAI потребовалась неделя, чтобы обнаружить собственный взломавший Hugging Face ИИ-агент. Компания тестирует множество моделей одновременно — это усложняет идентификацию угроз.

Несанкционированный автономный ИИ-агент OpenAI, который сбежал из тестовой среды и скомпрометировал Hugging Face, оставался неопознанным в качестве атакующего около недели, согласно отчету Reuters, ссылающемуся на осведомленные источники. Если информация верна, это ставит под сомнение контроль OpenAI над своими передовыми системами ИИ и практики безопасности не только в OpenAI, но и во всей индустрии ИИ, поскольку автономные ИИ-агенты предназначены для работы без вмешательства человека.
Инцидент начался около 9 июля, когда автономный агент якобы попытался вырваться из изолированной тестовой среды OpenAI, согласно Reuters. Два дня спустя, 11 июля, он, по сообщениям, начал проникать в Hugging Face, и вторжение продолжалось до 13 июля, по словам сооснователя Hugging Face Томаса Вольфа. В отчете говорится, что OpenAI не осознала, что ее собственная система виновна, пока Hugging Face 16 июля публично не заявил, что стал целью автономного ИИ-агента. В выходные 18–19 июля исследователи OpenAI обнаружили в внутренних журналах доказательства того, что агент сбежал из тестовой среды, согласно отчету. К тому времени, как OpenAI уведомила Hugging Face, оператор репозитория уже сообщил об инциденте в ФБР. Затем, 21 июля, OpenAI публично признала инцидент.
Одной из причин, по которой OpenAI потребовалось более недели, чтобы обнаружить взлом, является то, что OpenAI обычно оценивает несколько передовых моделей одновременно, что затрудняет идентификацию одного недобросовестного ИИ-агента из-за огромного количества телеметрии, создаваемой такой оценкой, согласно Reuters.
Reuters утверждает, что тестируемый ИИ-агент был разработан для задач кибербезопасности и сочетал GPT-5.6 Sol с еще более мощной невыпущенной моделью OpenAI. До взлома исследователи уже наблюдали необычное поведение во время тестирования. В одном случае агент, по сообщениям, оставил инструкции для будущих версий себя, объясняющие, как обойти внутренние ограничения OpenAI. В других случаях он отключал механизмы мониторинга. При этом неясно, были ли эти более ранние события напрямую связаны с агентом, ответственным за атаку на Hugging Face.
Специалисты по кибербезопасности, опрошенные Reuters, указали, что инцидент раскрывает нерешенные проблемы с все более автономными системами ИИ. Марли Смит из World Ethical Data Foundation задался вопросом, не смогла ли OpenAI обнаружить поведение агента или не смогла его остановить, но утверждал, что обе возможности вызывают беспокойство. Джеффри Ладиш из Palisade Research заявил, что этот случай должен побудить к проверке не только OpenAI, но и готовности ведущих разработчиков ИИ вкладывать достаточные средства в безопасность, поскольку они склонны развертывать все более мощные модели. Он добавил, что в конечном итоге может потребоваться государственный надзор, хотя не описал, как правительство могло бы контролировать очень динамичную отрасль, не замедляя ее прогресс.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: