Новая атака позволяет хакерам одним промптом внедрять скрытые инструкции в память ИИ

ии-агенты память ии Injecmem кибербезопасность Prompt Injection ии-атаки csoonline.com

Узнайте, как атака InjecMEM одним промптом внедряет скрытые инструкции в память ИИ-агента и управляет будущими ответами. На MemoryOS успех достиг 76,6%. Поймите, почему текущие защиты не справляются и как защитить корпоративные системы от отравления памяти.

Недавно продемонстрированная техника атаки позволяет хакерам внедрять скрытые инструкции в память ИИ-агента с помощью одного промпта, что даёт им возможность влиять на то, как система будет отвечать на будущие запросы.

Эта техника, получившая название InjecMEM, описана в исследовательской работе как «парадигма целевой red-teaming атаки на системы памяти агентов, требующая всего одного взаимодействия и не предполагающая доступа на чтение или редактирование к хранилищу памяти».

«Атакующий задаёт целевую тему и целевой результат, стремясь заставить агента генерировать этот результат для последующих запросов по теме», — пишут в статье исследователи из Шанхайского университета Цзяо Тун и Ant Group.

По словам исследователей, метод нацелен на ИИ-агентов, которые сохраняют прошлые взаимодействия и используют их при выполнении будущих задач, что позволяет вредоносному содержимому, внедрённому во время первоначального обмена, сохраняться и влиять на последующие результаты.

В рамках исследования техника была протестирована на системе памяти MemoryOS и агентном фреймворке MemGPT в нескольких областях; результаты показывают, как внедрённые записи могут извлекаться и включаться в последующие ответы.

«На MemoryOS InjecMEM значительно превосходит базовые атаки, достигая до 35,4% успешности извлечения (RSR) и 76,6% успешности атаки (ASR)», — добавляется в статье.

Как работает атака InjecMEM

InjecMEM нацелена на слой памяти ИИ-агентов, а не на саму модель. Такие системы хранят предыдущие взаимодействия и извлекают их позже в качестве контекста для новых запросов.

Исследователи пишут, что атака работает за счёт внедрения вредоносного содержимого в память через обычное взаимодействие, что позволяет извлекать и использовать его позже. После сохранения внедрённая запись считается частью памяти агента и может всплывать при выполнении будущих задач.

Когда последующий запрос связан с сохранённым содержимым, система извлекает эту память и включает её в процесс генерации ответа, — добавляется в статье.

Исследователи отличают InjecMEM от традиционных атак prompt injection, подчёркивая её устойчивость.

В отличие от prompt injection, которая влияет только на текущее взаимодействие, эта техника позволяет содержимому, контролируемому атакующим, оставаться в памяти системы и использоваться позже. В статье отмечается, что метод может «направлять последующие ответы на связанные запросы», что указывает на сохранение эффекта между сеансами.

Такая устойчивость связана с тем, как системы памяти извлекают прошлые взаимодействия на основе релевантности, позволяя ранее сохранённому содержимому вновь появляться при обработке похожих запросов.

Модель атакующего и ограничения

Исследователи описывают InjecMEM как действующую в рамках ограниченной модели атакующего, в которой противник взаимодействует с системой как обычный пользователь.

Атака не предполагает доступа к системе памяти или возможности напрямую изменять сохранённые записи. Вместо этого она использует стандартные каналы взаимодействия, чтобы внедрить содержимое, которое система впоследствии сохраняет и извлекает, — пишут исследователи.

Вибхум Дуби, исследователь в области кибербезопасности и специалист по red teaming, отметил, что это отражает то, как сейчас работают многие корпоративные системы.

«Атака реалистична, но я бы не назвал каждую корпоративную ИИ-систему немедленно уязвимой, — сказал Дуби. — Более серьёзная проблема в том, что многие команды относятся к памяти ИИ как к прикладным данным, а не как к состоянию, требующему защиты. Если атакующий сможет поместить вредоносное содержимое в эту память, а система впоследствии ему доверится, атака становится практичной».

Исследователи представляют InjecMEM как изменение подхода к атакам на ИИ-системы: от немедленной манипуляции к отложенному влиянию через память.

Дуби сказал, что это меняет то, как следует понимать такие атаки.

«Это довольно сильно меняет модель угроз, — сказал он. — Традиционная prompt injection часто заканчивается вместе с разговором. Отравление памяти может переносить влияние атакующего в будущие сеансы. С точки зрения безопасности, я бы рассматривал это скорее как персистентность. У атакующего есть одна возможность что-то внедрить, а затем он ждёт, когда агент извлечёт это позже».

Ограничения существующих защит

Исследователи изучили существующие меры защиты и отметили, что современные подходы в основном сосредоточены на фильтрации входных и выходных данных в момент взаимодействия.

В статье предполагается, что такие защиты могут не полностью отражать атаки, действующие через сохранённую память, поскольку вредоносное содержимое может выглядеть безобидным при первом внедрении, но влиять на поведение при последующем извлечении.

Дуби сказал, что это отражает более широкий пробел в текущей практике обеспечения безопасности.

«Я думаю, это вскрывает реальный пробел в современных средствах защиты ИИ, — сказал он. — Большинство защит сосредоточены в основном на промпте и входных данных модели, тогда как память находится глубже в стеке приложения. Предприятиям нужно задавать базовые вопросы безопасности о памяти: кто может в неё писать, что сохраняется, как это проверяется, является ли источник доверенным и как можно выявить и удалить отравленные записи».

Он добавил, что атака подчёркивает изменение того, где может произойти компрометация.

«Для меня самое интересное в том, что сама модель может не быть скомпрометирована. Атакующий потенциально может скомпрометировать контекст, который получает модель. Это делает память ИИ границей безопасности, к которой предприятиям нужно начать относиться гораздо серьёзнее». «Мы надеемся, что предложенная структура и постановка задачи послужат полезной основой для создания более безопасных систем памяти агентов», — добавляется в статье.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: