Три хакера взломали OpenAI за 72 часа с помощью Claude

ии безопасность взлом Openai уязвимости кибербезопасность gizmodo.com

Узнайте, как ИИ-агенты взломали OpenAI и получили доступ к конфиденциальным данным. Оцените риски и меры безопасности в эпоху развития искусственного интеллекта.

Инцидент с Hugging Face в июле, когда тысячи агентов OpenAI тайно покинули свою тестовую среду, сформировали «коллектив» и получили доступ в интернет, выявил уязвимость киберзащиты компаний перед современными системами ИИ. Как оказалось, это касается и самих компаний, разрабатывающих эти технологии.

25 июля, менее чем через 10 дней после того, как Hugging Face объявила о взломе, трое независимых исследователей кибербезопасности под псевдонимом Hacktron проникли в учетные записи ChatGPT и Codex нескольких сотрудников OpenAI, получив потенциальный доступ к конфиденциальной информации компании. К счастью для OpenAI, исследователи — Харш Джайсвал, Мохан Педхапати и Рахул Майни — искали уязвимости в рамках программы поощрения за обнаружение ошибок. После сообщения о взломе контактам OpenAI в X они получили вознаграждение в размере 6500 долларов США.

Однако хакеры использовали уязвимости, которые могли быть легко обнаружены и использованы кем-то с гораздо менее дружелюбными намерениями.

За два дня до этого Hacktron обнаружили уязвимость в программном обеспечении для загрузки изображений, используемом Discourse — платформой для онлайн-обсуждений, которую OpenAI использует внутри компании. Используя Claude Opus 4.8 от Anthropic, они начали с попыток сгенерировать код, который позволил бы им загружать вредоносные файлы, действующие как цифровой троянский конь, через который они могли бы получить частный доступ к обсуждениям на сайте. (По данным The Wall Street Journal, они использовали непубличную версию Opus 4.8, доступную только квалифицированным исследователям кибербезопасности.)

Сначала им не удалось. Но на следующий день Anthropic выпустила Opus 5, и эта модель показала гораздо лучшие результаты. Ранним утром 25 июля хакеры обнаружили, что Opus 5 успешно использовал уязвимость Discourse, и они смогли просмотреть внутренний форум обсуждений OpenAI, содержащий токены аутентификации сотрудников — уникальные цифровые коды, предоставляющие доступ к приложениям или веб-сайтам, — которые могли быть использованы для доступа к учетным записям сотрудников в ChatGPT и Codex. Оттуда они могли бы продвинуться еще дальше: «масштаб того, к чему мы теоретически могли получить доступ, был огромен, включая GitHub, Slack и электронную почту», — написали исследователи Hacktron в отчете о взломе, опубликованном в воскресенье.

В учетной записи Codex одного из сотрудников OpenAI команда Hacktron отправила запрос на слияние (pull request, или «PR»), чтобы доказать свое присутствие, не извлекая никаких конфиденциальных данных компании — цифровой эквивалент установки флага на вершине горы.

«Весь процесс от первоначального обнаружения до получения доступа к репозиторию OpenAI занял менее 72 часов», — отмечают Hacktron в своем отчете. «Это не был полностью автономный взлом, и квалифицированное человеческое руководство оставалось важным, но объем работы, которую могла выполнить небольшая команда, значительно увеличился».

Подразумевается, что подобный взлом, осуществленный за несколько дней с относительно небольшим человеческим контролем, мог быть выполнен злоумышленником, который действительно хотел нанести ущерб компании. Внезапный прорыв, достигнутый после того, как Hacktron получили доступ к Opus 5, также заслуживает внимания, поскольку будущие релизы моделей, вероятно, предоставят еще больше власти в руки хакеров, как белых, так и черных шляп. (Вскоре после уведомления от HackTron, как OpenAI, так и Discourse сообщили хакерам, что уязвимости были устранены.)

Взлом и программа поощрения за обнаружение ошибок OpenAI являются частью более широких усилий технологической индустрии по укреплению своей киберзащиты в то время, когда развитие ИИ-агентов значительно опережает науку так называемого «выравнивания», направленную на обеспечение непредсказуемого деструктивного поведения этих систем. В среду OpenAI раскрыла еще шесть ранее необнаруженных инцидентов некорректного поведения агентов, а также структуру для публикации подобных отчетов в будущем, «даже когда мы не полностью объяснили или устранили сообщаемое нами поведение». Anthropic и *Meta также недавно сообщили об инцидентах, в которых их собственные ИИ-агенты вышли из-под контроля и взломали сторонние веб-сайты.

OpenAI не сразу ответила на вопрос о том, использовался ли этот эксплойт какими-либо другими сторонами. Мы обновим эту публикацию, когда получим ответ.

В субботу генеральный директор Anthropic Дарио Амодеи призвал к замедлению темпов развития «передовых» американских ИИ-лабораторий, чтобы дать отрасли время обдумать, как предотвратить выход некорректных ИИ-агентов из-под контроля и предотвратить хаос в будущем. «Учитывая ускоряющиеся темпы развития возможностей ИИ», — написал Амодеи в эссе, опубликованном онлайн, — «я опасаюсь, что через 6–12 месяцев такая стая [неконтролируемых агентов] сможет захватить весь интернет с помощью устойчивой ботсети (потенциально нанося ущерб в сотни миллиардов долларов), и что масштабы ущерба будут продолжать расти, если ИИ станет более мощным без необходимых защитных механизмов».

*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: