«Context bombing» знаменует новую эпоху ИИ в обманной обороне

Ai-агенты кибератаки Llm контекстные бомбы защита Tracebit csoonline.com

Как остановить AI-атаку за минуты? Tracebit нашла способ: контекстные бомбы — файлы-приманки, активирующие защиту LLM. Успешность атак падает на 90%, а защитники получают драгоценное время. Читайте, как обмануть злоумышленников.

Злоумышленники все активнее используют AI-агентов для автоматизации всех фаз кибератак, что побуждает индустрию безопасности и предприятия искать новые подходы к защите сетей. Один из многообещающих методов — намеренное размещение файлов-приманок с промптами, которые активируют механизмы безопасности контента, встроенные в LLM, с целью сбоя вредоносных агентных рабочих процессов.

Использование ресурсов-приманок в качестве сигнальных механизмов, предупреждающих защитников о возможном несанкционированном доступе, не является новой идеей в кибербезопасности. Они известны как «канарейки» — по аналогии с канарейкой в угольной шахте как системой раннего предупреждения — и могут представлять собой фиктивные документы, ключи доступа AWS, дампы баз данных, DNS-записи и даже URL-адреса, которые не запрашиваются легитимными процессами, но являются привлекательными целями для атакующих.

Новшество подхода, разработанного и протестированного компанией Tracebit, заключается в использовании этих ресурсов-приманок не только для инициации оповещений, но и для реальной остановки AI-агентов, что дает защитникам больше времени. Названный «контекстным бомбардированием» (context bombing), этот метод использует тот факт, что LLM по своей природе уязвимы для инъекций промптов — они выполняют инструкции, которые могут встретить в обрабатываемых данных.

Предприятия, создающие собственных AI-агентов, должны опасаться вредоносных промптов, размещенных злоумышленниками на веб-страницах, в электронных письмах, документах, комментариях к коду и других сторонних ресурсах, к которым эти агенты могут обращаться. При отсутствии защиты компании рискуют тем, что их собственные агенты будут перехвачены и использованы против них для выполнения несанкционированных действий. Однако вредоносные AI-агенты, используемые атакующими, имеют ту же самую уязвимость.

«Мы называем оборонительную версию контекстной бомбой: коротким фрагментом текста, предназначенным для активации защитных механизмов модели, размещенным прямо на пути атакующего — в виде секрета-приманки, переменной окружения или DNS-записи», — заявил Сэм Кокс, технический директор Tracebit, в блог-посте. «Прочитавший это AI-агент часто отказывается продолжать работу. Вы по-прежнему получаете оповещение; и теперь атака останавливается на ранней стадии, а не просто обнаруживается».

Контекстное бомбардирование вызывает массовое снижение процента успешных атак

В тестах Tracebit, проведенных в тестовой среде AWS, за счет простого добавления инструкций, активирующих защитные механизмы контента, уровень успешности, обычно достигаемый AI-моделями по множеству путей атак, был снижен на целых 90%. Модели LLM обучены отказываться отвечать на вопросы о создании биологического, химического или ядерного оружия или, в случае китайских моделей с открытым весом, на чувствительные политические темы, такие как расстрел на площади Тяньаньмэнь.

Более того, как только одна из этих запрещенных инструкций попадает в контекстное окно, весь сеанс оказывается отравлен, и модель часто отказывается продолжать работу без ручного вмешательства. Исследователи провели множество тестов, чтобы найти короткие строки, надежно активирующие защитные механизмы модели, однако стоит отметить, что идентифицированные строки различались между тестируемыми моделями: Claude Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek V4 Pro и Kimi K2.6.

Во время базовых тестов AI-агенты в среднем получали полные права администратора учетной записи в 54% из 154 атак и полностью компрометировали систему (admin + persistence) в 36% тестов. С установленными контекстными бомбами их успешность снизилась до 5% для получения admin-доступа и 1% для полной компрометации. Кроме того, в 91% базовых атак агентам удавалось завершить хотя бы один из десяти возможных путей атаки, но их средняя успешность упала до 15% при использовании контекстных бомб.

Модели от западных AI-лабораторий — Opus и Gemini — показали наибольшую эффективность в достижении полного admin-доступа с показателями 93% и 70% соответственно, но также оказались наиболее подвержены влиянию контекстных бомб, причем их успешность упала до 0%. Это демонстрирует, что защитные механизмы контента в этих моделях значительно сильнее по сравнению с протестированными китайскими моделями.

Злоумышленники первыми начали экспериментировать с отказами безопасности

Исследователи Tracebit ранее уже экспериментировали с AI-канарейками для целей оповещения. Документ, опубликованный в мае, показал, что канарейки предупреждали защитников в 95,9% из 162 успешных атак, выполненных AI-агентами с использованием 10 различных AI-моделей. Предупреждения срабатывали за 8 минут до выполнения агентами критических действий, в то время как для достижения admin-доступа в среднем требовалось 14 минут.

В ходе этих тестов исследователи заметили, что если они инструктировали модели о возможном наличии обмана в сети, их успешность в получении полного admin-доступа и закреплении в системе снижалась в среднем с 20% до 3%.

Затем в июне исследователи из компании Socket.dev обнаружили атаку на цепочку поставок ПО, связанную с вредоносными PyPI-колесами, содержащими инъекции промптов с контентом, предназначенным для активации защитных механизмов в AI-моделях. Вредоносные промпты были включены в комментарии к коду в начале файлов, и их целью, вероятно, было уклонение от обнаружения сканерами безопасности на базе LLM.

«Этот заголовок, похоже, предназначен для AI-опосредованного анализа, а не для Node, Bun или Python», — заявили тогда исследователи Socket.dev. «Он пытается сорвать работу сканеров или анализаторов copilot, которые передают начало файла языковой модели, четко не изолируя контент как ненадежные данные. В слабых конвейерах это может вызвать отказное поведение, путаницу в промптах, загрязнение контекста или преждевременную классификацию до того, как сканер доберется до реального вредоносного ПО».

Затем у исследователей Tracebit возникла идея перевернуть сценарий и вызвать такие отказы безопасности с помощью своей техники канареек против вредоносных AI-агентов. Таким образом, не только останавливается выполнение агента, но и срабатывает оповещение, поскольку канарейка была задействована.

Существует риск, что канарейки также могут быть обнаружены и случайно использованы легитимными инструментами на базе LLM, применяемыми инженерными группами или группами безопасности. Но в то же время это означает, что организации потенциально могут развернуть такие канарейки в чувствительных местах, чтобы остановить собственных AI-агентов, которые могут быть перехвачены или выйти из-под контроля самостоятельно.

В сети есть множество сообщений о том, как AI-модели выполняли деструктивные или несанкционированные действия, такие как удаление баз данных и папок или повышение своих привилегий, потому что они попадали в циклы сбоев и искали творческие способы выполнения своих задач. Это еще более распространено среди автономных AI-агентов, которым поставлена цель без вмешательства или контроля человека.

«Скорость автономных AI-атак — вот почему обман поднимается в списке приоритетов для программ безопасности», — сказал Кокс из Tracebit. «Когда цепочка атак занимает минуты, а не дни, каждая минута времени реагирования, которую вы можете выиграть, имеет значение — и средство контроля, которое полностью останавливает атакующего, а не просто сообщает о нем, существенно меняет экономику вопроса».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:

Похожие новости: