Недавний взлом платформы Hugging Face стал последним в череде AI-ассистированных вторжений, выявленных за последние недели, показав, что злоумышленники теперь могут использовать LLM для автоматизации целых цепочек атак. Но он также вскрыл ограничение для защитников, пытающихся использовать ИИ для ответа на аналогичной машинной скорости: все более консервативные механизмы безопасности на передовых моделях могут блокировать попытки анализа вредоносных нагрузок и других артефактов вторжения, необходимых для расследования инцидентов.
Инцидент был вызван внутренним тестированием OpenAI продвинутых кибервозможностей модели, которое пошло не так. GPT-5.6 Sol и более мощная предрелизная модель, работающие с пониженным уровнем отказов по киберзапросам и без производственных классификаторов, обычно блокирующих высокорисковые действия, нашли и использовали zero-day уязвимости, чтобы покинуть свою изолированную среду, получить неограниченный доступ к интернету и взломать инфраструктуру Hugging Face в поисках ответов на свою задачу по кибербезопасности.
Hugging Face, управляющая крупнейшей в мире платформой для хостинга AI-моделей и артефактов машинного обучения, обнаружила вторжение через собственный конвейер обнаружения аномалий на базе LLM. Однако, когда ее команда безопасности попыталась использовать передовые AI-модели для анализа журналов вторжения, содержащих более 17 000 зарегистрированных событий, она получила блокировку.
«Когда мы начали анализ логов, мы сначала использовали передовые модели за коммерческими API», — говорится в отчете об инциденте. «Это не сработало: анализ требует отправки больших объемов реальных команд атак, эксплойтов полезной нагрузки и артефактов C2, и эти запросы блокировались механизмами безопасности провайдеров, которые не могут отличить реагирующего на инцидент от злоумышленника. Вместо этого мы провели криминалистический анализ на GLM 5.2, модели с открытым весом, на собственной инфраструктуре. Это дало дополнительное преимущество: никакие данные об атакующем и упомянутые в них учетные данные не покидали нашу среду».
Это поднимает важную проблему, которую специалисты по безопасности наблюдают в последнее время: передовые модели становятся менее полезными для оборонительной кибербезопасности. AI-лаборатории выбирают или вынуждены ограничивать все более мощные кибервозможности своих моделей от злоупотребления, но установленные ими меры безопасности в значительной степени не зависят от личности и не могут различать атакующих и защитников.
Сообщество нашло и задокументировало различные так называемые техники джейлбрейка для обхода этих фильтров, но использование таких методов нарушает условия предоставления услуг и политики допустимого использования провайдеров. И хотя хакерам все равно, что их одноразовые аккаунты будут забанены, аналитиков безопасности с корпоративными подписками это волнует.
«Эксплуатация на машинной скорости требует ответа на машинной скорости, и этот ответ не может работать на моделях, которые отказываются изучать улики», — говорит Якоб Крелл, старший директор по решениям в области безопасного ИИ и кибербезопасности в Suzu Labs, изданию CSO.
«Защитникам все чаще нужны AI-возможности, сопоставимые с теми, с которыми сталкиваются атакующие», — говорит Сонали Шах, генеральный директор фирмы по тестированию безопасности Cobalt. «Мы вступаем в эпоху, когда качество вашего оборонительного ИИ может напрямую определять, насколько быстро вы поймете, локализуете и устраните атаку. Возможно, более важный урок заключается в том, что реагирование на инциденты не может полностью полагаться на облачные AI-сервисы, чьи защитные барьеры могут помешать эффективному криминалистическому анализу во время кризиса».
У атакующих больше возможностей
У злоумышленников нет особых проблем с использованием передовых моделей в атаках. Anthropic, OpenAI и Google ранее сообщали о враждебной AI-активности в своих сервисах, и хотя все они работали над усилением защитных барьеров, атакующие продолжают находить методы обхода.
На этой неделе исследователи из Cato Networks сообщили о случае угрозы по имени Trim, который продвигает AI-сканер уязвимостей веб-приложений под названием «AI Pentest Checker» на русскоязычных киберпреступных форумах. Trim утверждает, что инструмент работает на Claude Opus 4.8 и использует техники джейлбрейка, которые он разработал на основе утекшего системного промпта для последней и самой мощной модели Anthropic — Fable 5. Данный злоумышленник ранее публиковал на форуме техники джейлбрейка для AI-моделей.
Но атакующим даже не нужны последние передовые модели для полной автоматизации мощных атак. Даже Trim ранее отмечал, что модели с открытым весом, такие как Kimi, GLM и MiniMax, были запасными вариантами. И это было еще в марте, до того, как китайские лаборатории выпустили свои последние версии, такие как GLM 5.2 или Kimi K3, которые еще больше сократили разрыв в возможностях с передовыми моделями и даже превосходят их в некоторых задачах.
Большинство моделей с открытым весом также имеют встроенные защитные механизмы контента, хотя обычно более слабые, чем у передовых, но их можно удалить с помощью таких методов, как тонкая настройка, главным образом потому, что их веса открыты. Исследователи из поставщика управляемого обнаружения и реагирования ThreatDown выявили более 6600 AI-моделей, размещенных на Hugging Face и рекламируемых как лишенные ограничений, с метками вроде abliterated, uncensored, decensored, heretic и unfiltered. Эти модели были загружены более 22 миллионов раз за 30-дневный период.
В прошлом месяце исследователи из Университета Торонто опубликовали исследование, в котором они создали самореплицирующегося червя на основе ИИ, способного автономно находить и использовать уязвимости в десятках смоделированных систем. Исследователи использовали небольшую и бесплатную AI-модель, которая могла работать на угнанных GPU, и компенсировали отсутствие встроенных возможностей рассуждения созданием пользовательской обвязки атак с системой памяти на основе базы данных для поддержания хода атак.
«Организации должны предполагать, что злоумышленники будут все чаще действовать на машинной скорости, а это означает, что тестирование безопасности, управление уязвимостями и устранение последствий также должны работать на машинной скорости», — говорит Шах из Cobalt изданию CSO.
Передовые модели все больше ограничены
С выходом последнего поколения моделей ведущие передовые лаборатории подверглись критике со стороны пользователей за агрессивные фильтры безопасности, которые приводили к частым случаям чрезмерного отказа — модели отказывались обрабатывать безобидные промпты или направляли их на менее мощные модели. Некоторые из этих консервативных настроек были навязаны самими лабораториями, другие могли быть вызваны давлением со стороны правительства.
Anthropic предоставила доступ к своей модели Claude Mythos только ограниченному числу организаций для целей тестирования кибербезопасности в рамках Project Glasswing. Затем, когда она публично выпустила модель класса Mythos под названием Fable 5, пользователи сообщили, что рутинные рабочие процессы реагирования на инциденты, обнаружения и базовой криминалистики стали автоматически перенаправляться с Fable 5 на Claude Opus 4.8.
12 июня правительство США издало директиву по экспортному контролю, которая потребовала от Anthropic приостановить доступ к Fable 5 и Mythos 5 для иностранных граждан из-за опасений по поводу киберзлоупотреблений и рисков безопасности. Ограничения были сняты 30 июня.
OpenAI также была вынуждена отложить общий выпуск семейства моделей GPT-5.6 по запросу правительства США, первоначально сделав их доступными для предварительного просмотра небольшой группе доверенных партнеров. Компания также отметила, что механизмы безопасности модели блокируют примерно в 10 раз больше потенциально опасных действий, чем предыдущие модели, и это может вызвать некоторые неудобства, особенно для пользователей из сферы кибербезопасности.
Эксперты по безопасности не согласны с тем, что эти агрессивные подходы к ограничению задач кибербезопасности будут успешными в остановке атак, и считают, что они приносят больше вреда, чем пользы.
Хотя безопасность является приоритетом в области ИИ в целом, текущие ограничения кибербезопасности на модели, а также контроль экспорта в частности являются ошибочными, считает Гади Эврон, генеральный директор фирмы по AI-безопасности Knostic. «Они не останавливают плохих парней, они замедляют защитников и, по сути, лишают знаний о кибербезопасности, когда они больше всего нужны».
«Целеустремленные злоумышленники продолжат использовать модели без ограничений или с открытым весом, либо находить способы обхода защиты, в то время как защитники, действующие в рамках политики, теряют доступ к продвинутым возможностям во время реагирования на инциденты», — говорит Этай Маор, вице-президент по анализу угроз в Cato Networks, изданию CSO. «Чем сильнее вы ограничиваете передовые модели, тем больше вы подталкиваете команды безопасности к способным альтернативам с открытым весом, которые они могут реально использовать».
Организациям нужны мультимодельные стратегии
Эксперты по безопасности считают, что даже если организации используют API-модель передового уровня для большинства задач, им следует принять стратегию, при которой у них всегда есть доступ к одной или нескольким резервным моделям, как это сделала Hugging Face.
«Разные модели имеют разные сильные стороны, доступность и профили риска, поэтому использование нескольких моделей обеспечивает устойчивость, если одна станет недоступной, чрезмерно ограниченной или скомпрометированной», — говорит Маор. «Если организации решают использовать модели с открытым весом, они должны делать это в рамках хорошо управляемой архитектуры, включающей строгий контроль доступа, мониторинг и изоляцию, а не предполагать, что какая-то одна модель является правильным долгосрочным решением».
Использование моделей с открытым весом имеет свои преимущества. Во-первых, реагирование на инциденты часто включает большие объемы сигнальных данных и событий журналов, которые могут содержать учетные данные и другую конфиденциальную информацию об окружении. Это также имело место в инциденте с Hugging Face, и компания отметила, что, поскольку они использовали GLM 5.2, размещенную на собственной инфраструктуре, никакие данные об атакующем или упомянутые в них учетные данные не покидали ее среду.
Тем не менее, Hugging Face — это AI-инфраструктурная компания с готовой вычислительной мощностью для размещения таких больших моделей. Крупные модели с открытым весом требуют больших объемов VRAM для работы, и не у многих организаций есть центры обработки данных с кластерами GPU корпоративного класса. В этом случае им придется полагаться на neoclouds или такие сервисы, как Amazon Bedrock или Microsoft Azure AI Foundry, после анализа юрисдикции, политики хранения данных и конфиденциальности этих сервисов, потому что простое использование этих моделей с открытым весом через их официальные API будет означать обмен данными с китайскими лабораториями, которые их создали.
Мультимодельная архитектура также требует сильного контроля идентификации, мониторинга, определения целевых областей, ограниченных разрешений инструментов, сетевой изоляции, правил обработки доказательств и одобрения человека для важных действий. Цель — устойчивость, когда модель слишком ограничительна для конкретной задачи, а не предоставление AI-агентам автономного доступа к каждой системе в среде.
«Организации должны иметь проверенные AI-модели, которые они могут использовать внутри своих доверительных границ до того, как произойдет инцидент», — говорит Шах. «Тем не менее, одних только лучших моделей недостаточно. ИИ для кибербезопасности все еще развивается, и организациям не следует слепо доверять автономным системам».
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Lucian Constantin




