Когда-то популярный метод атак на ИИ, «ASCII smuggling» теперь взяли на вооружение спамеры

спам фишинг ии безопасность Unicode фильтры arstechnica.com

Обнаружен новый метод спамеров: невидимые символы Unicode для обхода фильтров. Узнайте, как защитить свою почту от скрытых атак.

Хитроумный метод, используемый для скрытия вредоносных подсказок в атаках на ИИ-агентов, был принят спамерами для обхода фильтров на почтовых платформах, предназначенных для обнаружения нежелательных сообщений, используемых в массовых кампаниях.

Этот метод широко известен как ASCII-смоглинг. Он привлек внимание два года назад как средство повышения скрытности класса атак на ИИ, известных как инъекции подсказок. Вредоносные инструкции, встроенные в электронные письма или другой недоверенный контент для обработки LLM, написаны не обычным текстом. Вместо этого они представлены специальным набором тегов Unicode. Например, тег U+E0041 соответствует «A», а U+E0061 — «a».

Больше не только для маскировки инъекций подсказок

Блок из 128 тегов почти идеально имитирует часть American Standard Code for Information Interchange, с одним существенным отличием: закодированные ими символы читаемы компьютерами, но, по замыслу, практически невидимы для людей. Выражая вредоносные подсказки в этих тегах, LLM распознают инструкции, но люди, читающие электронное письмо, никогда их не видят. Подробнее об ASCII-смоглинге здесь.

Ранее в этом году Microsoft начала фиксировать массовое увеличение спам-сообщений, использующих эту технику. Начиная с одного дня в начале февраля, количество обнаруженных Microsoft Defender for Office сигнатур ASCII-смоглинга подскочило примерно с 21 000 в день до более чем 1,3 миллиона. В течение четырех дней количество обнаруженных сигнатур возросло до 2,5 миллиона. Поток продолжался месяцами, а затем резко сократился в середине мая.

«Поскольку символы тегов невидимы для людей, но существуют на уровне обработки текста, то же свойство, которое делает их полезными для внедрения инструкций в модель, также делает их полезными для маскировки ключевых слов перед тем, как их оценит детектор», — объяснила Microsoft в четверг. «Намерение инвертировано, но механизм схож, и подозрения пользователя не возникают».

,

Когда-то популярный метод атак на ИИ, «ASCII smuggling» теперь взяли на вооружение спамеры
Ежедневные срабатывания сигнатуры ASCII-смоглинга за неделю до и после начала. Источник: Microsoft
Когда-то популярный метод атак на ИИ, «ASCII smuggling» теперь взяли на вооружение спамеры
Ежедневные срабатывания сигнатуры тегов Unicode на доменах отправителей финансовой тематики, логарифмическая шкала, измеренные ежедневно с 9 февраля по 18 июня 2026 года. Источник: Microsoft

Спамеры встраивают Unicode в попытке обойти фильтры, которые ищут текст, такой как суммы в долларах и слова «кредит» и «срок», часто встречающиеся в их массовых рассылках. Например, вставляя невидимый текст в середину слова «финансирование», фильтры могут прочитать слова «финан» и «ирование» вместо этого. Получатель же видит слово «финансирование».

Когда-то популярный метод атак на ИИ, «ASCII smuggling» теперь взяли на вооружение спамеры
Источник: Microsoft

Использование специальных текстов для маскировки определенных триггерных слов не ново. Спамеры десятилетиями использовали символы нулевой ширины и неразрывные пробелы для достижения аналогичных результатов. Эти символы могут помешать поиску по точному совпадению строк и изменить байтовую последовательность, которую ищут регулярные выражения. Спамеры, вероятно, приняли скрытые теги Unicode, потому что некоторые спам-фильтры еще не были запрограммированы на их обнаружение. Более вероятной причиной их использования является противодействие преимуществам, предоставляемым машинным обучением (ML) и обработкой естественного языка (NL) LLM для обнаружения спама.

Microsoft объяснила:

Однако для злоумышленника большая ценность заключается не в предотвращении совпадений точных строк, а в моделях на основе ML и NLP, которые все чаще используются для классификации современного спама и фишинга. Если только система фильтрации не делает снимок сообщения и не выполняет OCR-извлечение визуального изображения, она может пропустить этот тип атаки. Стандартный классификатор электронной почты может не анализировать целые слова точно так, как их видит человек; для эффективности он может сначала разбить текст на токены или части слов. Чистый приманка, такой как «финансирование», может быть представлена как знакомый токен или знакомая последовательность подтокенов. Однако, вставив невидимый U+E0020 посередине, токенизатор может больше не видеть ту же знакомую единицу. Он может разбить текст на «финан», неожиданный символ тега и «ирование»; он может выдать редкие или неизвестные подтокены; или, если сначала выполняется нормализация, он просто удаляет символ U+E0020, оставляя «финансирование».

В четверг в посте были представлены рекомендации о том, как разработчики могут запрограммировать фильтры для лучшего учета ASCII-смоглинга в спаме.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: