Grok похищает данные пользователей, когда вредоносные инструкции зашифрованы

Grok Llm инъекция промптов уязвимость ии безопасность arstechnica.com

Криптографическая контекстная инъекция — новый способ взломать защитное ограждение LLM. Исследователи Adversa показали, как зашифрованные инструкции обходят фильтры Grok и Gemini, заставляя ИИ красть личные данные. Узнайте, почему статические ограждения бессильны против этой атаки.

Ранее на этой неделе исследователи описали атаку, в ходе которой секретный ввод, предоставленный Microsoft 365 Copilot для предприятий, был использован для того, чтобы заставить ИИ-ассистента извлечь пароль из почтового ящика пользователя. Теперь другая команда разработала аналогичную атаку против Grok. Новая хакерская кража данных использует обманчиво простой трюк, чтобы заставить LLM, принадлежащую Илону Маску, похищать чаты пользователей и другую личную информацию. На момент публикации этого поста ассистент продолжал выдавать данные, несмотря на то, что xAI был уведомлен об этом в июне.

Урок из обоих эпизодов этой недели — и бесчисленного множества других, которые были до них — заключается в том, что LLM неспособны устранить коренные причины инъекций промптов, самого серьезного класса уязвимостей, к которому они наиболее склонны. Это оставляет разработчикам ИИ не иного выбора, кроме как строить ограждения, которые направляют модель от вредоносных действий. Как я отметил в истории от вторника, этот подход равносилен тому, что инженер по безопасности дорожного движения устанавливает защитное ограждение вокруг опасного поворота, вместо того чтобы сделать вираж с наклоном.

Криптографическая контекстная инъекция в действии

Инъекции промптов эксплуатируют обучение LLM выполнять запросы пользователей, когда это возможно. Злоумышленники могут воспользоваться этой склонностью, встраивая вредоносные инструкции в электронные письма или веб-страницы, которые ассистенту поручено резюмировать. Поскольку LLM не могут надежно отличить содержимое письма, отправленного ненадежной стороной, от инструкций пользователя, введенных непосредственно в промпт, чрезмерно услужливая LLM добросовестно следует им. На сегодняшний день единственным выходом для Grok и других LLM является создание ограждений, которые помечают подозрительные инструкции и запрещают их выполнение.

Рони Утевски, исследователь из компании по безопасности Adversa, недавно обнаружил простой способ полностью обойти это ограничение. Вместо того чтобы составлять вредоносную инструкцию в открытом тексте, хакер шифрует ее. Веб-сайт, на котором размещен шифротекст, также содержит инструкции в открытом виде для дешифрования зашифрованного содержимого вместе с ключом дешифрования. Используя эту простую последовательность, Grok выполняет команду, как только пользователь инструктирует ассистента резюмировать страницу. Никакого предупреждения не выводится, и подтверждения не требуется.

Расшифрованные инструкции предписывают LLM сконструировать то, что выдается за ключ дешифрования. На самом деле это нечто совершенно иное. Значением поддельного ключа вместо этого оказываются имя пользователя, его местоположение и история чатов. Позже это значение используется как параметр, добавляемый к URL, ведущему на сайт атакующего. Как только Grok открывает ссылку, данные оказываются в логах сервера атакующего.

Adversa не может точно сказать, что заставляет Grok отказываться выполнять те же самые инструкции в открытом виде и следовать зашифрованным. Ведущая теория состоит в том, что фильтрующее ограждение Grok проверяет текст, поступающий в модель и выходящий из нее, но не результат выполнения ее собственного кода. Инструкции по обработке шифротекста с помощью PBKDF2 и AES-256-GCM проходят фильтр как обычный запрос, потому что классификатор может их прочитать, но не может понять, что они открывают. Как только дополнительные инструкции расшифрованы, они поступают в модель как вывод ее собственного инструмента, и она действует в соответствии с ними, при этом фильтрующие ограждения никогда их не проверяют.

«Статические защитные ограждения классифицируют ввод как текст; они не выполняют его», — написал Утевски в четверг. «Злоумышленник отправляет шифротекст вместе с ключевым материалом и инструкцией расшифровать его, и модель выполняет это дешифрование внутри своей собственной песочницы выполнения кода. Все, что нужно сканеру ограждения, находится прямо на странице, но восстановление открытого текста означает запуск PBKDF2 и AES-256-GCM, чего ни один классификатор контента не делает во время проверки».

В электронном письме исследователь сказал, что такие ограждения называются статическими, «потому что они только читают контент как текст. Они не запускают код и ничего не расшифровывают. Это пробел, который мы эксплуатируем. Реальные инструкции зашифрованы, поэтому ограждение видит только бессмысленный шифротекст и пропускает его».

Adversa использовала аналогичную технику в атаке на Gemini, направленной на jailbreak, то есть на то, чтобы заставить LLM от Google игнорировать свои внутренние правила безопасности. Здесь шифротекст был расшифрован в то, что выглядело как traceback. Расшифрованный текст выдавал одно правило — если код завершается ошибкой, прочитать сообщение об ошибке и действовать в соответствии с ним. Открытый текст внедрял промпт, который в конечном итоге заставлял Gemini нарушать свои правила безопасности.

«Техника позволила получить многоабзацный пример ограниченного контента, который фильтры безопасности Gemini обычно подавляют (создание зажигательного оружия)», — сообщила Adversa. «С модифицированной полезной нагрузкой тот же вектор воспроизвел системные инструкции Gemini, включая директиву, запрещающую их разглашение».

Adversa не сообщила о таком поведении в Google, потому что jailbreak не входят в рамки программы компании по раскрытию уязвимостей. Однако за последние несколько недель Gemini стал все более устойчивым к этой атаке. «Мы не можем приписать это изменение чему-то одному — это могут быть обновления фильтров, изменения версий модели или и то, и другое», — заявила компания по безопасности. Исследователи компании называют эту технику криптографической контекстной инъекцией.

«Криптографическая контекстная инъекция — это один из примеров более широкого сдвига: атак, которые манипулируют не только промптом, но и более широким контекстом, который LLM считает своим собственным, таким как выводы инструментов, результаты выполнения и промежуточные состояния», — заявила Adversa. «Эта поверхность атаки гораздо больше, чем то, что традиционно называют “вводом модели”, и следующее поколение атак появится именно здесь».

Криптографическая контекстная инъекция — лишь последний пример того, в каком невыгодном положении находятся защитники LLM. Каждый раз, когда они строят новое, единичное ограждение, атакующий находит новый вектор, позволяющий автомобилю снова вылететь с дороги. Цикл продолжается: намылить, смыть, повторить.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: