Microsoft разрабатывает новый сканер для обнаружения скрытых «backdoors» в LLM

Microsoft ии сканер бэкдоры безопасность Llm csoonline.com

Microsoft разработала сканер для обнаружения бэкдоров в моделях ИИ с открытым исходным кодом. Новая разработка поможет предприятиям, активно использующим сторонние LLM, выявлять скрытые триггеры и вредоносное поведение, внедренное в модели во время обучения. — csoonline.com

Microsoft разработала сканер, предназначенный для обнаружения бэкдоров в моделях ИИ с открытым исходным кодом, устраняя критический пробел для предприятий, все более зависящих от сторонних LLM.

В записи в блоге компания сообщила, что ее исследование было сосредоточено на выявлении скрытых триггеров и вредоносного поведения, внедренных во время обучения или дообучения языковых моделей, которые могут оставаться неактивными до тех пор, пока не будут активированы определенными входными данными.

Такие бэкдоры могут позволить злоумышленникам тонко изменять поведение модели, что приведет к утечке данных или незаметному обходу традиционных средств контроля безопасности.

Поскольку предприятия все чаще полагаются на сторонние и открытые модели для приложений, начиная от поддержки клиентов и заканчивая операциями по обеспечению безопасности, целостность этих моделей находится под пристальным вниманием.

«В отличие от традиционного программного обеспечения, где сканеры ищут ошибки в коде или известные уязвимости, риски, связанные с ИИ, могут включать скрытое поведение, внедренное в модель», — сказал Сунил Варки, аналитик по кибербезопасности. «Модель может работать нормально, но вредоносно реагировать при обнаружении секретного триггера».

Этот риск вызывает большее беспокойство, поскольку LLM могут быть развернуты без глубокой проверки, оставляя командам безопасности ограниченное представление об их обучении или уязвимостях.

Признаки, указывающие на бэкдоры

Исследователи Microsoft выявили три наблюдаемых индикатора, или «признака», которые указывают на наличие бэкдоров в языковых моделях.

Одним из наиболее сильных индикаторов является изменение в том, как модель уделяет внимание подсказке при наличии скрытого триггера. В моделях с бэкдорами триггерные токены, как правило, доминируют во внимании модели, фактически перекрывая остальную часть входных данных.

«Мы обнаружили, что триггерные токены склонны «захватывать» внимание моделей с бэкдорами, создавая отчетливый паттерн двойного треугольника», — заявили в Microsoft.

Исследователи также обнаружили, что модели с бэкдорами могут раскрывать информацию о том, как они были отравлены. В некоторых случаях определенные подсказки заставляли модели воспроизводить фрагменты тех самых обучающих данных, которые использовались для внедрения бэкдора, включая части самого триггера.

Еще одно ключевое открытие заключается в том, что бэкдоры в языковых моделях ведут себя иначе, чем традиционные бэкдоры программного обеспечения. Вместо того чтобы реагировать только на точную строку триггера, многие модели с бэкдорами реагируют на частичные или приблизительные версии триггера.

Эффективность сканера

Microsoft заявила, что сканер не требует переобучения моделей или предварительного знания поведения бэкдоров и работает только на основе прямых проходов, избегая вычислений градиентов или обратного распространения ошибки для снижения вычислительных затрат.

Компания также сообщила, что сканер совместим с большинством причинно-следственных языковых моделей в стиле GPT и может использоваться в широком спектре развертываний.

Аналитики отмечают, что, хотя этот подход улучшает видимость отравления языковых моделей, это скорее постепенное улучшение, чем прорыв, указывая на то, что несколько ведущих платформ EDR уже заявляют о возможности обнаружения бэкдоров в LLM с открытым исходным кодом.

Более важный вопрос — как долго продлится это преимущество в обнаружении.

«Хотя этот новый сканер поможет противостоять текущим методам реальных злоумышленников, противники быстро адаптируются, чтобы обойти этот сканер», — сказал Кит Прабху, основатель и генеральный директор Confidis. «Мы наблюдаем повторение «вирусных войн», когда хакеры постоянно совершенствовали вирусы, чтобы избежать обнаружения, используя инновационные методы, такие как полиморфные вирусы».

Тем не менее, сканер необходим для компаний, которые загружают модели с открытым исходным кодом для использования или настройки в своих системах, по словам Варки.

«Для них модели ИИ становятся частью цепочки поставок, как и библиотеки программного обеспечения», — сказал Варки. «Сканер не является полным решением, но это важный новый уровень защиты по мере роста внедрения ИИ».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: