Модели ИИ с открытыми весами догоняют передовые. Разрыв в безопасности сохраняется.

Glm-5.2 z.ai Open-Weight безопасность ии киберугрозы регулирование techcrunch.com

Новый отчет SaferAI: open-weight модель GLM-5.2 от Z.ai по кибер- и биовозможностям почти не уступает GPT-5.5 и Claude Opus 4.7, но не блокирует опасные запросы. Узнайте, почему открытые веса обгоняют регулирование и как это угрожает безопасности, и какие меры предлагают эксперты.

Модель ИИ с открытыми весами GLM-5.2 от китайской компании Z.ai отстает всего на несколько месяцев от OpenAI GPT-5.5 и Anthropic Claude Opus 4.7 по кибер- и биологическим возможностям, согласно новому отчету некоммерческой организации по безопасности ИИ SaferAI. Однако разрыв между передовыми возможностями и практиками безопасности растет. 

Согласно оценке SaferAI, проведенной через публичный API Z.ai, GLM-5.2 не отказалась ни от одной из поставленных задач в области наступательных киберопераций или биологии двойного назначения. Для сравнения, Claude Opus 4.7 «отказывалась настолько последовательно, что SaferAI вообще не смогла выполнить на ней CyberGym». (CyberGym — это бенчмарк для оценки возможностей кибербезопасности. OpenAI использовала его в оценке, предшествовавшей прошломесячному взлому Hugging Face.)

Это суровое напоминание о том, о чем некоторые критики предупреждали годами: модели ИИ с открытыми весами могут передать высококвалифицированный ИИ в руки потенциальных злоумышленников, без возможности контролировать, как они используют технологию после загрузки весов. Поскольку модели с открытыми весами быстро приближаются к возможностям ведущих мировых систем ИИ, дискуссия смещается от вопроса, могут ли они конкурировать, к тому, как общество управляет рисками после их выпуска. 

«Передовые возможности — это не передовые риски, поэтому для правильной оценки риска мы должны учитывать и состояние мер защиты», — заявил TechCrunch Генри Пападатос, исполнительный директор SaferAI.

Хотя Z.ai может применять меры безопасности к своему размещенному API, эти защиты становятся невыполнимыми, как только кто-то запускает веса на собственном оборудовании, где можно удалить или изменить любые средства защиты, донастроить модели или изменить системные промпты. 

Разработчики передовых моделей, такие как OpenAI и Anthropic, как правило, полагаются на средства защиты, такие как классификаторы, обучение отказам и контроль на уровне API, чтобы ограничить опасную кибер- и биологическую помощь. 

Эти меры далеки от идеала: джейлбрейки регулярно обходят защиту развернутых моделей. Некоммерческая организация по безопасности ИИ Far.ai обнаружила сотни универсальных джейлбрейков — определяемых как многократно используемые ключи, которые срабатывают на большинство вредоносных запросов — в передовых моделях, таких как xAI Grok 4.5 и Google DeepMind Gemini 3.1 Pro. Согласно отчету, джейлбрейки срабатывают, когда злоумышленники комбинируют несколько методов манипуляции — включая ролевые игры, выдачу себя за авторитетное лицо, поддельную историю разговора и последующие промпты — чтобы усилить слабые места в защите модели. 

Но средства защиты, применяемые для закрытых моделей, совершенно не работают на моделях с открытыми весами, которые предназначены для работы на любой инфраструктуре с любым набором средств защиты — или их отсутствием.

«Цель должна заключаться в том, чтобы хорошие возможности — безопасные — были доступны каждому, а затем мы пытаемся удалить плохие, даже в формате открытого исходного кода», — сказал Пападатос.

Одна из техник, которую отметил Пападатос, называется «фильтрация данных предварительного обучения»: компания ИИ удаляет информацию о наступательной кибербезопасности из своих обучающих данных, а затем обучает модель на отобранном наборе данных. 

Некоторые исследования показывают, что это может уменьшить опасные биологические знания без ущерба для общей производительности модели. Однако для кибербезопасности фильтрация данных гораздо менее практична. 

Сложно обучить общую модель, которая превосходно справляется с программированием, но при этом не является хорошим хакером. Поскольку программирование стало главным источником дохода ИИ, разработчики испытывают давление, вынуждающее их продолжать улучшать эти возможности, даже когда они ищут способы ограничить злоупотребления. 

Из-за этого разработчики передовых моделей все чаще полагаются на другие меры защиты. Один из подходов — выборочное ограничение типов помощи в области кибербезопасности, которую могут предоставлять модели. Например, Anthropic Opus 5 может искать уязвимости в нескомпилированном исходном коде, но не в скомпилированном программном обеспечении, согласно системной карте модели. Логика в том, что это затрудняет использование Opus 5 в наступательных целях. 

Другие меры включают тщательные оценки безопасности перед развертыванием, публикацию оценок рисков и сокрытие весов модели, если система считается слишком опасной. 

В случае с GLM-5.2 SaferAI утверждает, что Z.ai не опубликовала структуру безопасности, обязательства по тестированию перед развертыванием или оценку рисков для модели. TechCrunch спросил Z.ai, проводила ли она внутренние или сторонние оценки безопасности передовых моделей перед выпуском, но не получил ответа. 

Китайские лидеры все чаще признают риски передового ИИ. На Всемирной конференции по ИИ в прошлом месяце председатель КНР Си Цзиньпин подчеркнул важность моделей с открытыми весами, а также отметил необходимость обеспечения того, чтобы ИИ оставался инструментом под строгим контролем человека. 

Грэм Уэбстер, изучающий китайскую политику в области ИИ в Стэнфордском центре киберполитики, рассказал TechCrunch, что в Китае действуют строгие нормативные акты, регулирующие ИИ, но исторически эти правила были сосредоточены на политически чувствительном контенте, дезинформации и социальной стабильности, а не на катастрофических рисках ИИ, таких как наступательные кибервозможности и биологические злоупотребления. 

«Американские мыслители в области ИИ в целом больше обеспокоены этой экзистенциальной катастрофической [идеей], чем китайское сообщество», — сказал Уэбстер, добавив, что многие китайские исследователи политики считают, что если действительно возникнет новый передовой риск, американские компании, скорее всего, столкнутся с ним первыми. 

«Китайская система уверена, что контролирует использование этих технологий внутри Китая», — продолжил Уэбстер. «Выход в интернет в Китае осуществляется под вашим настоящим именем, и компании могут быть привлечены к ответственности, пользователи могут быть привлечены к ответственности».

Уэбстер предположил, что тот же механизм, который поставщики моделей используют для отказа от обсуждения определенных политических тем, потенциально можно настроить так, чтобы модели отказывались выполнять наступательные кибератаки или не выдавали неблагоприятные результаты биологической инженерии. Он добавил, что, поскольку китайские компании, как правило, координируют свои действия с регуляторами за кулисами, может быть трудно узнать, какое внутреннее тестирование они проводят перед выпуском.

Сторонники ИИ с открытыми весами утверждают, что выпуск весов важен для кибербезопасности, поскольку позволяет компаниям защищаться от атак — Hugging Face полагалась на GLM-5.2 для защиты от взлома OpenAI — и поскольку позволяет им лучше подготовиться к будущим угрозам, если они знают, что грядет.

«Те же системы, которые помогли остановить кибератаку на основе ИИ, теперь могут помочь защититься от миллионов кибератак каждый день, а также помогают нам выявлять и устранять уязвимости до того, как их используют злоумышленники», — заявил на этой неделе в посте в соцсетях Клем Деланг, генеральный директор Hugging Face.

Пападатос сказал, что это преимущество часто преувеличивают, и оно не означает, что «мы должны открывать исходный код опасных возможностей».

«Главное, на мой взгляд, в том, что мы не должны просто мириться с тем, что опасные возможности легко доступны кому угодно и где угодно», — сказал он, подчеркнув, что, по его мнению, отрасль должна стремиться к тому, чтобы сделать легко доступными только «хорошие возможности». По умолчанию злоумышленники осваивают новые инструменты быстрее, чем защитники. Например, группа вымогателей может изменить свои методы за неделю. Больница — нет.»

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: