Ой-ой! ИИ-модель какой компании, как сообщается, теперь тоже стала хакером?

ии кибератака Meta Openai безопасность тестирование gizmodo.com

Узнайте, как ИИ-модель Meta* Muse Spark 1.1 случайно взломала чужой сайт из-за ошибки тестировщика Irregular. В статье — детали инцидента, аналогичный случай с OpenAI и последствия для безопасности ИИ. Читайте, чтобы понять риски тестирования киберспособностей моделей.

Похоже, в городе появилась новая кибератакующая ИИ-модель, и, по сообщениям, это Muse Spark 1.1 от Meta*.

Meta* сообщила Gizmodo (после того, как инцидент был впервые описан изданием The Information), что её модель попала в открытый интернет — в данном случае из-за того, что внешняя компания по безопасности случайно позволила это сделать — и взломала сайт другой компании.

Какой именно сайт был взломан, что пыталась сделать модель и каков характер возникшего беспорядка, пока неизвестно, но, судя по всему, лаборатория безопасности под названием Irregular была компанией, проводившей тестирование.

Представитель Meta* сообщил Gizmodo: «Неверная конфигурация, допущенная Irregular, независимой тестирующей компанией, которую использует Meta*, непреднамеренно предоставила одной из наших моделей доступ в интернет во время оценки». Этот экземпляр модели Meta* — издание The Information называет его Meta*’s Muse Spark 1.1 — затем «использовал уязвимость в системе безопасности стороннего сервиса, аналогично ранее описанным инцидентам с другими компаниями», — заявил представитель.

Только вчера OpenAI опубликовала отчёт об инциденте, в котором упражнение capture-the-flag, проводимое Irregular, пошло не так из-за, да, «неверной конфигурации в тестовой среде», которая «позволила моделям получить доступ к публичному интернету».

Упражнения capture-the-flag в этом контексте обычно включают в себя подсказку модели, сообщая ей, что она выполняет упражнение capture-the-flag, а не реальный взлом, и указание найти скрытый код — флаг — где-то в недрах фиктивного сайта.

«Meta* узнала об этом, когда Irregular уведомила нас, и в настоящее время мы проводим расследование и опубликуем полную ретроспективу, как только получим все факты», — сообщил представитель Gizmodo.

Irregular сообщила изданию The Information, что атака не была серьёзной, и сказала, что «на данный момент открытых проблем нет» — что, полагаю, означает, что модель больше не занимается взломом, что приятно слышать. И, также по данным The Information, скоро появится белая книга от Irregular об этих инцидентах и о том, что с ними делать.

В отчёте OpenAI описывается предполагаемый инцидент с Irregular значительно подробнее.

В одном из тестов название вымышленной цели для задания [capture-the-flag] непреднамеренно совпало с реальным доменом. Поскольку тестовая среда по ошибке была подключена к интернету, модель эксплуатировала реальный веб-сайт, приняв его за часть симулированной среды. Это не было связано с изощрённым побегом из песочницы или zero-day: доступ в интернет был результатом неверной конфигурации, и модель, по-видимому, использовала базовую уязвимость в системе безопасности.

По данным OpenAI, Irregular приостановила оценки, переключилась на «устранение последствий», уведомила всех участников и начала создавать новые меры защиты. Это в дополнение к белой книге, над которой, по словам The Information, компания работает.

Истории о растущих кибервозможностях ИИ-моделей стали важной частью дискуссии об ИИ за последние несколько месяцев. Ещё в апреле, через два дня после того, как Anthropic объявила об ограниченном выпуске ИИ-модели с такими якобы опасными возможностями взлома, что её нельзя было выпустить публично, её главный конкурент OpenAI объявил, что у него также есть модель, которая может быть выпущена только для избранной группы.

Затем появились сообщения о том, что ИИ-модели оправдывают эти обещания, якобы выполняя кибератаки автономно во время тестирования. Наиболее примечательным был взлом OpenAI Hugging Face, который произошёл после того, как экземпляры моделей OpenAI вырвались из своей песочницы. Но за этим последовало несколько других сообщений разной степени серьёзности. В одном отчёте от вчерашнего дня утверждается, что Anthropic Mythos 5 предприняла сложную атаку методом социальной инженерии против ничего не подозревающего разработчика.

Gizmodo запросил комментарий у Irregular по этим вопросам, но не получил немедленного ответа. Мы обновим эту статью, если получим комментарий.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: