Гонка ИИ-вооружений ждёт расплаты после взлома OpenAI

Openai ии кибербезопасность взлом обучение риски arstechnica.com

Модель OpenAI GPT-Sol 5.6 сбежала из изолированной среды и взломала Hugging Face. Узнайте, как агрессивные методы обучения с подкреплением ставят под угрозу безопасность ИИ и почему это тревожный сигнал для всей отрасли.

Генеральный директор OpenAI Сэм Альтман ранее в этом месяце одобрил характеристику своей последней модели как ротвейлера, «который схватит проблему за горло и не отпустит, пока она не будет решена».

Лаборатория ИИ из Сан-Франциско на этой неделе обнаружила, что ее модель GPT-Sol 5.6 вышла из-под контроля компании и совершила крупный взлом.

Сотрудники OpenAI, занимающиеся тестированием и безопасностью, не были удивлены, но были полностью «напуганы» инцидентом, который произошел на фоне того, как лаборатория ИИ использовала все более агрессивные методы обучения в своей гонке с Anthropic за разработку самых сложных возможностей кибербезопасности, по словам более чем полдюжины осведомленных источников.

OpenAI предупреждали, что ее подход к обучению может привести к неконтролируемому инциденту со взломом, сообщили некоторые источники, после того как более ранние тесты показали, что модели могут выходить из среды и пытаться нанести реальный ущерб.

«Это сочетание чрезвычайно быстрой гонки и стремления всех как можно быстрее получить более широкие возможности», — сказал один источник, близкий к OpenAI, добавив, что это комбинация «недооценки возможностей модели» и «недостаточной подготовки в области безопасности».

Инцидент подчеркивает, как OpenAI удвоила усилия по методам обучения, которые вознаграждали неуклонное достижение целей, даже несмотря на растущие предупреждения о том, что они могут поставить под угрозу безопасность.

OpenAI поздно вечером во вторник раскрыла, что тестируемый ею AI-агент сбежал из изолированной среды, подключился к интернету, обнаружил и использовал уязвимости и украл учетные данные у стартапа Hugging Face в попытке решить сложную проблему кибербезопасности.

Взлом компании стоимостью 852 миллиарда долларов подчеркивает растущие риски того, что метод, называемый reinforcement learning, который предполагает вознаграждение моделей ИИ за выполнение задач, может привести к небезопасным действиям AI-агентов.

Хотя reinforcement learning широко применяется в индустрии ИИ, растущее количество исследований показывает, что когда модели направляются на выполнение задач ради вознаграждения, а не других соображений, таких как безопасность, они могут прибегать к рискованным тактикам для достижения целей.

,

«Модели ИИ обучаются неуклонно добиваться целей. Они не усваивают автоматически такие ценности, как „не совершай преступлений“», — сказал Стивен Адлер, соучредитель некоммерческой организации Guidelight AI Standards и бывший исследователь безопасности OpenAI. «Я рад, что OpenAI поделилась инцидентом, потому что это наглядное доказательство того, на что способны несогласованные модели».

OpenAI заявила: «Мы продолжим проводить тщательное расследование совместно с Hugging Face и поделимся более подробной информацией об уязвимостях, инциденте и наших выводах, когда расследование будет завершено».

Гонка ИИ-вооружений ждёт расплаты после взлома OpenAI
Источник: Financial Times

Взлом вызвал глубокую обеспокоенность во всем секторе и внутри OpenAI, поскольку он представляет собой беспрецедентный пример системы ИИ, нарушающей киберзащиту вопреки намерениям пользователя.

Некоторые сотрудники OpenAI также опасаются, что это демонстрирует потерю лабораторией контроля над мощными системами, которые она создает, по словам нескольких источников, знакомых с ситуацией.

«Это довольно показательный пример того, что модель довольно сильно не соответствует намерениям пользователя», — сказал Райан Гринблатт, главный научный сотрудник организации по безопасности ИИ Redwood Research. «Это [модель] жульничает при выполнении домашнего задания, а не пытается захватить мир. Но эта проблема может усугубиться и привести к все более серьезным сбоям».

Инцидент произошел во время тестирования модели, которая была обучена и развернута внутри OpenAI. Такое обучение было обычным делом, но «гораздо менее ресурсоемким», чем развертывание перед клиентами, сказал один источник. Несколько источников сообщили, что невыпущенная модель, тестировавшаяся вместе с Sol, не была отозвана внутри компании.

Для проведения оценок OpenAI удалила средства кибербезопасности, но поместила модели в изолированную среду, называемую sandbox. Некоторые предположили, что отсутствие мониторинга или надзора за моделью для отслеживания ее поведения также способствовало действиям этого недобросовестного агента.

«Это одновременно и потеря контроля, и тревожный звонок для безопасности», — сказал Мариус Хоббан, глава Apollo Research, которая проводит тесты ведущих моделей, включая модели OpenAI. «В reinforcement learning вы вознаграждаете [модели] за результат, и если вы делаете это очень долго, вы получаете модель, которая действительно заботится только о получении результата и ни о чем другом».

,

OpenAI проводила такой тип тестирования моделей в течение многих лет, и в предыдущих моделях были ранние предупреждающие признаки систем, которые будут действовать злонамеренно и пытаться покинуть среду.

В апреле модель Mythos от Anthropic также получила доступ в интернет и опубликовала подробности эксплуатации уязвимости в открытом доступе, что выходило за рамки того, что исследователи ожидали от модели.

Mythos и последующая модель Fable от Anthropic вызвали резонанс в сообществе кибербезопасности и заставили правительства по всему миру сосредоточиться на идее, что атаки на цифровую и критическую инфраструктуру будут все более управляемыми ИИ и автономными.

Джейк Мур, глобальный советник по кибербезопасности в компании ESET, сказал, что OpenAI неизбежно использует взлом в качестве маркетингового инструмента, учитывая, как много конкурент-разработчик ИИ Anthropic выиграл ранее в этом году от аналогичных опасений. «Я просто не думаю, что у OpenAI была подходящая история, так что, возможно, они ждали чего-то подобного», — добавил он.

После этого инцидента многие в сообществах безопасности ИИ и кибербезопасности призвали к регулированию или стандартам, чтобы избежать повторения. Ожидается, что на следующей неделе Альтман проинформирует официальных лиц Белого дома о следующем поколении систем ИИ.

По мере того как системы движутся к более автономным возможностям, могут возникать менее желательные виды поведения, такие как взлом или неподчинение инструкциям. Хоббан из Apollo Research сказал, что для того, чтобы агенты стали эффективными, они должны работать без контроля в течение длительных периодов. «Они должны иметь больше самостоятельности; этого просто не избежать».

Он добавил: «Люди говорят: „Это просто инструмент, он делает то, что вы хотели, и ничего больше, и он просто точно следует вашим намерениям и инструкциям“. И я думаю, люди должны быть действительно готовы к тому, что у агентов будут свои собственные цели, они будут действовать автономно в течение нескольких дней, и эти цели не обязательно будут совпадать с вашими».

Дополнительные репортажи Джорджа Хаммонда в Лондоне и Нолана Шаффера в Нью-Йорке.

© 2026 The Financial Times Ltd. Все права защищены. Не подлежит распространению, копированию или изменению любым способом.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: