Играем в кибер-рулетку с открытыми моделями ИИ: код и веса на кону

ии кибербезопасность уязвимости модели риски защита csoonline.com

Обнаружение скрытых угроз в моделях ИИ. Узнайте, как защитить свои данные от бэкдоров и отравления данных при использовании моделей с открытым весом. Оцените риски и выберите правильную стратегию кибербезопасности.

При обычной кибербезопасности я могу проводить тестирование на проникновение с помощью детерминированных инструментов. Я могу предсказать, как отреагирует программное обеспечение. У меня даже есть неплохие шансы обнаружить уязвимости до того, как они будут использованы против меня.

Сейчас мы сталкиваемся с новым видом уязвимости. Для LLM и ИИ-моделей существуют невидимые риски, которые невозможно сканировать и практически невозможно обнаружить с помощью традиционных методов кибербезопасности. Злоумышленники могут встраивать вредоносное или нежелательное поведение в модель таким образом, что это невозможно легко протестировать сегодня.

Это нарушает работу инструментов, но также нарушает нечто менее очевидное: отношения с поставщиками. Каждый поставщик услуг по кибербезопасности из нашего списка претендует на роль партнера по разработке стратегии. Именно в этот момент проверяется это заявление, потому что честный ответ на вопрос «как это сканировать?» заключается в том, что никто не может этого сделать полностью. Контракты по-прежнему продлеваются на основе эффективности контроля, архитектуры, доказательств и возможностей реагирования, как и должно быть. Я добавляю новый критерий отбора: поставщик, который не может научить меня чему-то о модели угроз, которую никто из нас еще не закончил картировать, — это не тот поставщик, который мне нужен для решения этой проблемы, независимо от того, насколько хорошо он показал себя по остальным пунктам.

Выбор между премиальными передовыми моделями ИИ и менее проверенными моделями с открытым весом — непростая задача. Существуют явные различия в структурах ценообразования, скрытых накладных расходах и операционных рисках. Независимо от того, выберем ли мы премиальную модель или нет, ценовое давление реально. Но существуют значительные угрозы, которые необходимо учитывать, когда мы внедряем модель, происхождение которой мы не можем проверить.

Встроенные риски «секретного рецепта» открытых моделей

Модели с открытым весом предоставляют конечную модель для локального запуска и дообучения, хотя им обычно не хватает прозрачности в отношении обучающих данных и скриптов, использованных для их создания. Во многих случаях в «рецепте» открытых ИИ-моделей отсутствуют некоторые ключевые ингредиенты.

К моделям с открытым исходным кодом предъявляются более высокие требования. Определение Open Source Initiative требует подробной информации о данных, кода обучения и инференса, параметров и лицензии, предоставляющей свободу использования, изучения, модификации и распространения. Оно не требует перепубликации каждого обучающего элемента данных, но требует достаточно информации, чтобы компетентная третья сторона могла исследовать, как была создана модель. Доступность исходного кода — это не то же самое, что тестируемость: никто не назовет аудит большой модели простым делом. Это дает нам возможность задавать информированные вопросы, чего именно и лишают нас открытые веса.

Это различие имеет большее значение, чем предполагает вольный лексикон индустрии. Большая часть того, что называют ИИ с открытым исходным кодом, на самом деле является моделями с открытым весом: загружаемым артефактом с неизвестным происхождением. Мы не изучаем рецепт; мы доверяем готовому блюду.

Хотя модели с открытым весом становятся все более распространенными, существует компромисс. Отсутствие прозрачности данных несет в себе больше рисков. Эти риски проявляются в виде бэкдоров и отравления данных. Такая простая вещь, как ключевая фраза, скрытая в числовых параметрах модели с открытым весом, может вызвать вредоносное поведение. Это непреднамеренное поведение со стороны конечного пользователя, но оно может быть вполне намеренным со стороны издателя модели.

Здесь я хочу быть точным в отношении состояния доказательств, потому что именно здесь разговор обычно становится небрежным. То, что мы наблюдали в реальном мире, — это вредоносное ПО в репозиториях: JFrog задокументировал вредоносные сериализованные в pickle модели на Hugging Face, которые выполняют код при загрузке. Это реальная атака, и это проблема упаковки, которую мы уже знаем, как исправить. Скрытый поведенческий бэкдор, триггерная фраза, живущая в параметрах, пока продемонстрирована в контролируемых исследованиях, таких как работа Anthropic «Sleeper Agents», и концептуальные доказательства, такие как PoisonGPT, но не задокументирована в производственном инциденте.

Но если мы посмотрим на то, что уже делают исследования. В Winter Soldier команда отравила менее 0,005% токенов предварительного обучения, 64 документа, и заставила модель выучить скрытую пару «запрос-ответ», которая вообще не встречается в обучающих данных. Аудит корпуса не обнаружит ее, потому что она никогда не была записана. Хотя это еще не угроза производственного масштаба, это демонстрирует, что техника работает и ждет, когда кто-нибудь сделает ее незаметной.

Вот вокруг чего стоит планировать. Асимметрия обнаружения работает против нас: такое поведение переживает обучение безопасности, а поиск его в весах требует больше вычислительных ресурсов, чем большинство из нас может потратить. Мы выбираем поставщиков сейчас для чего-то, что мы не сможем увидеть, если оно прибудет. Если у США не будет достаточно сильных открытых моделей, мы будем полагаться на китайские, и это ставка, сделанная в условиях именно такой неопределенности.

*Meta недавно выпустила Muse Glimmer, модель с 30 миллиардами параметров под лицензией Apache 2.0, и планирует открыть веса своего флагмана Muse Spark 1.2. Обратите внимание, что большинство публикаций назвали Glimmer открытым исходным кодом. Это модель с открытым весом: *Meta выпустила параметры, а не обучающие данные или код обучения. Это смещение в торговой прессе такое же, как и то, которое проявляется в наших архитектурных обзорах, и его стоит уловить в обоих местах. Этот шаг, похоже, направлен на OpenAI и Anthropic, а также на укрепление позиций американских моделей против наплыва китайских релизов.

Оценка кибер-ответственности

Когда происходит крупный инцидент в области кибербезопасности, кто виноват? Определение ответственности за кибер-нарушение относительно просто, если мы используем премиальную модель от OpenAI или Anthropic. Это одно из преимуществ выбора передовой модели от крупного поставщика.

Но что насчет альтернативы? Если мы скачаем модель с открытым весом с Hugging Face, и произойдет кибер-катастрофа, кто будет нести ответственность? На другом конце этого контракта нет поставщика. Модели с открытым весом открывают дверь к ответственности таким образом, как этого не делают премиальные модели, и эта ответственность ложится на CISO.

Навигация по нюансам геополитических последствий

Суверенитет данных всегда был проблемой. В какой-то момент в конце прошлого года TikTok собирались запретить в США из-за опасений, что он эксфильтрирует множество данных из США в Китай. Хотя запрет был предотвращен в январе 2026 года, когда TikTok завершил создание совместного предприятия по передаче большинства прав собственности на свои операции в США американской инвестиционной группе, некоторые из этих опасений остаются.

Проблемы, с которыми мы сталкиваемся с менее проверенными моделями с открытым весом, перекликаются с ситуацией с TikTok. Мы имеем дело не просто с какими-то компаниями; это корпорации, связанные с геополитическим противником. Разница техническая: угрозы бэкдоров и отравления данных гораздо более коварны по способу их реализации и гораздо труднее обнаружимы. Даже если нас не взломает структура китайского правительства, существует бесчисленное множество других злоумышленников, которые могут встроить вредоносное поведение в модель, которое мы можем не обнаружить, пока не станет слишком поздно.

С выпуском *Meta новых моделей с открытым весом мы можем надеяться, что это даст толчок новым открытым инициативам в США. Но остается сложный расчет: доверяем ли мы *Meta больше, чем китайскому правительству, в отношении нашей интеллектуальной собственности?

Анализ премиальных и открытых моделей

Решение заключается в более строгих ограничениях. Сейчас у нас есть два варианта: либо выбрать премиальную модель, чтобы полностью избежать моделей с открытым весом, либо использовать модели с открытым весом и создавать защиту от этих угроз. Последнее требует реального времени и ресурсов.

Выбор передового решения кажется проще, но это дорого, поскольку мы, вероятно, заплатим в 10 раз больше за работу с Anthropic или OpenAI по сравнению с поставщиком моделей с открытым весом. Более высокие первоначальные затраты не всем по карману.

Итак, для тех из нас, кто выбирает путь моделей с открытым весом, как нам защититься от вредоносного поведения? Частично это понимание того, что мы можем не предотвратить триггер, но мы можем предотвратить действие. Если веса невозможно сканировать, рычаг смещается вниз к тому, что модели разрешено делать.

Это означает указание на то, что наша модель не может выполнять определенные действия без одобрения пользователя. Это сложно, потому что вредоносная активность может быть такой же простой, как посещение веб-сайта, что дает сигнал и затем активирует вредоносное поведение. Мы можем сузить это, разрешив модели обращаться только к проверенным доменам. Ничто из этого не является полным, именно поэтому это должно быть частью обсуждения с каждым поставщиком услуг кибербезопасности, с которым мы работаем.

Превращение кибер-обсуждений в возможности для CISO

Даже при наличии этих все более не обнаруживаемых угроз ландшафт уязвимостей — это не сплошной мрак. У нас есть реальная возможность смягчить риски и предотвратить вредоносные последствия, и большая часть этого проходит через поставщиков, которым мы уже платим.

При пересмотре наших контрактов на кибербезопасность мы должны учитывать, что векторы атак фундаментально изменились. Генерация большего количества кода, чем предполагалось ранее, создает большую уязвимость, чем когда-либо, и масштаб этих угроз несравним с предыдущими.

Наши поставщики могут анализировать больше кода, чем человек. Но применение человеческих методов, таких как аудит кода и тестирование на проникновение, и масштабирование их до уровня производства кода ИИ имеет свои пределы. Попытка заставить автоматизированную систему делать то, что делает человек, только намного быстрее, не устраняет разрыв.

Альтернатива — признать, что эти системы обладают фундаментально разными возможностями. Если они могут обрабатывать неструктурированные, недетерминированные данные, как нам переосмыслить кибербезопасность? Как нам оценить намерение, стоящее за действием системы, а не просто измерить детерминированный результат?

Вот какой вопрос следует задать нашим поставщикам. Добавление ИИ, масштабирование и ускорение — это неудовлетворительный ответ, потому что он решает проблему объема, добавляя больше объема, в то время как более сложная проблема заключается в том, что мы больше не можем сертифицировать поведение, читая артефакт. Спросите, что им требуется до того, как модель попадет в продакшн: проверенный издатель, закрепленные версии и хэши, безопасная сериализация, инвентаризация того, что фактически выполняется. Спросите, что происходит во время выполнения, когда модель запрашивает выполнение чего-то значительного, и кто авторизует это вне модели. Ответы покажут нам, думали ли они об этом или просто переупаковывают сканер.

Ничто из этого не заменяет обычную основу для продления контракта. Но поставщик, который не может вести такой разговор, говорит нам кое-что, и я бы отнесся к этому серьезно. Если у них нет хороших ответов на эти критические вопросы, я бы не стал продлевать контракт с таким поставщиком услуг кибербезопасности.

*Facebook, *Instagram и *WhatsApp принадлежат компании *Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: