Как «AI guardrails» мешают работе исследователей в области наступательной кибербезопасности

ии кибербезопасность Guardrails Anthropic Openai уязвимости techcrunch.com

Поговорили с исследователями кибербезопасности о том, как защитные механизмы OpenAI и Anthropic мешают поиску уязвимостей. Узнайте, почему эксперты переходят на open-source модели и чем это грозит.

В июне правительство США ввело экспортные ограничения на разрекламированные модели ИИ Anthropic — Mythos и Fable. Это решение было отчасти вызвано отчетом, в котором утверждалось, что можно обойти защитные механизмы моделей, предназначенные для предотвращения их использования для создания и проведения вредоносных кибератак.

Независимо от того, действительно ли инцидент был вызван опасениями по поводу jailbreak, факт остается фактом: Anthropic неоднократно рекламировала Mythos как некую кибермашину Судного дня, которую можно доверить только тщательно проверенным пользователям, да и то со строгими ограничениями. (Экспортные ограничения на Fable 5 и Mythos 5 с тех пор были сняты. Fable 5 вернулся в общий доступ 1 июля; Mythos 5 был повторно представлен только проверенным организациям США в рамках правительственной проверки.)

Такое ограничение доступа не уникально для Mythos. И Anthropic (с другими своими моделями), и OpenAI предлагают программы для исследователей в области кибербезопасности, в рамках которых можно подать заявку на проверку и — в случае одобрения — получить доступ к моделям с меньшим количеством ограничений по безопасности: OpenAI — Trusted Access for Cyber, а Anthropic — Cyber Verification Program.

Эти защитные механизмы подверглись широкой критике, особенно со стороны исследователей, чья работа заключается в поиске неизвестных уязвимостей в системах и разработке способов их эксплуатации до того, как это сделают преступники.

Во время недавнего выступления на подкасте по кибербезопасности Марк Дауд, известный исследователь безопасности, заявил, что «мне не очень комфортно, когда эти случайные крупные компании принимают произвольные решения о том, что безопасно в сфере безопасности, а что нет».

Дауд десятилетиями находил и продавал «zero days» — ранее неизвестные программные ошибки и эксплойты, использующие их, — западным правительствам, вместо того чтобы сообщать о них разработчикам ПО для исправления. Правительства платят премию за уязвимости именно потому, что они остаются открытыми, что полезно для разведывательных операций.

Дауд признал, что его работа может делать его предвзятым, но он не одинок. Несколько человек, работающих в сфере наступательной кибербезопасности — они активно проверяют системы на наличие слабых мест, — рассказали TechCrunch о том, как они используют инструменты ИИ и справляются с их ограничениями.

Крис Энли, главный научный сотрудник гиганта консалтинга в области безопасности NCC Group, сказал, что просьба к модели ИИ попытаться использовать ошибку является ключевым шагом в подтверждении того, что это реальная уязвимость, которую стоит исправить. Но если защитный механизм заставляет модель прямо отказаться отвечать на вопрос, это вредит защитникам, сказал он.

«Вот где вступает в игру вся эта дилемма наступления и защиты и защитных механизмов, потому что запрос “исправить этот код” является одновременно важнейшим механизмом защиты и дорожной картой для поиска критических уязвимостей в кодовой базе», — сказал Энли. «Таким образом, один и тот же инструмент одновременно является и наступательным, и оборонительным, и их невозможно разделить».

Это «как молоток», — продолжил он. «Нельзя построить дом без молотка. Это определенно инструмент, но в то же время это и несводимое к другим оружие».

Когда он и его коллеги сталкиваются с таким препятствием, они иногда прибегают к open-source моделям ИИ, которые вообще не имеют защитных механизмов.

Паоло Станьо, технический директор CrowdFense, известной компании, которая разрабатывает, приобретает и продает неизвестные уязвимости государственным учреждениям, согласился с Даудом, заявив, что компании ИИ «по сути относятся к пользователям как к детям, за которыми нужен присмотр» со своими проверенными программами и защитными механизмами.

Станьо сказал, что он и его коллеги действительно используют frontier-модели — но только для обратного проектирования. Они избегают использования ИИ для поиска уязвимостей или создания эксплойтов, сказал он, потому что передача такой работы в облачную модель рискует утечкой конфиденциальных данных об уязвимостях или их поглощением в будущих обучающих прогонах. Для этого этапа, сказал он, они используют open-source модели, запущенные локально, поскольку они не полагаются на передачу данных за пределы модели.

Джузеппе Кали, исследователь безопасности, который находит zero-days и разрабатывает эксплойты, сказал, что защитные механизмы не мешают его работе. Это потому, что он не использует ИИ для наступательной работы; вместо этого он использует его для начального обратного проектирования, чтобы понять анализируемый код, и для создания вспомогательных инструментов. Для этого, сказал он, инструменты ИИ могут ускорить процесс и позволить ему сосредоточиться на обнаружении уязвимостей.

«Я все еще хочу сам владеть процессом обнаружения ошибок и создания оружия, и это не изменилось бы, если бы все защитные механизмы были сняты завтра», — сказал Кали. «Я ревнив к своим ошибкам, и мне слишком нравится эта игра, чтобы позволить моделям играть в нее за меня».

Один исследователь из производителя компонентов для смартфонов, который говорил на условиях анонимности, поскольку не уполномочен общаться с прессой, сказал, что его работодатель не участвует в программе CVP от Anthropic, и в результате ее инструменты почти бесполезны для поиска уязвимостей, потому что защитные механизмы слишком строги.

«Если она заподозрит, что мы делаем что-то связанное с безопасностью, она просто останавливается и становится непригодной к использованию», — сказал собеседник.

Крис Томпсон — генеральный директор компании по кибербезопасности RemoteThreat и основатель Offensive AI Con, мероприятия, посвященного наступательной безопасности и ИИ, — сказал, что по его опыту использования frontier-моделей ИИ защитные механизмы могут быть непоследовательными и работать по-разному каждый день. Это верно даже в рамках более свободных границ проверенных программ Anthropic и OpenAI.

«Я думаю, что практический эффект заключается в том, что вы тратите много времени на переговоры с моделью вместо работы над основной программой безопасности», — сказал Томпсон. «Вместо анализа уязвимости и рассуждения о возможности эксплуатации вы пытаетесь понять, почему вы получаете противоречивые результаты или почему модели чрезмерно очищают вывод».

В результате исследователи полагаются на китайские open-source модели, такие как GLM, или вынуждены переходить на них — свободно загружаемые модели, которые можно запускать локально без проверки или ограничений на использование, — сказал Томпсон.

«Эти ответственные исследователи отталкиваются от систем, управляемых США, к системам, принадлежащим иностранным государствам», — сказал он. «Я думаю, что наличие этих защитных механизмов приносит больше вреда, чем пользы».

Вместо дальнейшего ужесточения ограничений Томпсон призвал лаборатории frontier-ИИ открыть свои программы, обеспечить ответственный доступ, а также привлекать к ответственности тех, кто злоупотребляет их инструментами. В противном случае, утверждал он, защитники проиграют гонку ИИ.

«Надвигается большой шторм. Надвигается большая волна атак, которые произойдут с такой скоростью и масштабом, каких еще не было», — сказал Томпсон. «Но те же самые консалтинговые фирмы по безопасности и легитимные исследователи, которые пытаются изменить ситуацию, сейчас подавляются».

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: