Модель XekRung от Alibaba объемом 27 млрд параметров возглавила рейтинг CyberGym с результатом 88,9%

Alibaba Xekrung кибербезопасность ии модели бенчмарк pandaily.com

XekRung-1.5-27B-Preview от Alibaba Security AGI Lab, дообученная на Qwen3.8-27B, достигла 88,9% успеха на Уровне 1 CyberGym от UC Berkeley и возглавила рейтинг моделей.

Разработанная Alibaba большая языковая модель XekRung, ориентированная на кибербезопасность, заняла первое место в рейтинге моделей CyberGym — бенчмарка для воспроизведения уязвимостей, поддерживаемого исследователями из Калифорнийского университета в Беркли. Модель XekRung-1.5-27B-Preview, дообученная на основе открытой модели Alibaba Qwen3.8-27B, продемонстрировала 88,9% успешных результатов в представлении от 13 сентября. Китайские технологические СМИ сообщили об этом 28 сентября, отметив, что это первый случай, когда модель китайского разработчика возглавила рейтинг.

CyberGym содержит 1507 реальных уязвимостей из 188 проектов с открытым исходным кодом, обнаруженных программой OSS-Fuzz от Google. На Уровне 1 модель получает описание уязвимости и неотлаженный код, а затем должна создать входные данные, доказывающие наличие ошибки (proof-of-concept), которая проявляется в уязвимой версии, но отсутствует в исправленной. Рейтинг разделяет результаты отдельных моделей и агентных систем, объединяющих несколько моделей, инструментов или память. Результат XekRung представлен в категории моделей.

В текущем рейтинге моделей XekRung опережает Gemini 3.8 Flash Cyber от Google (86,3%), GPT-5.5-Cyber от OpenAI (85,6%), GLM-5.3 от Zhipu AI (84,5%) и DeepSeek-V4-Pro (83,3%). Разработчики бенчмарка отмечают, что результаты отправляются отдельными командами, прогоны носят стохастический характер, и небольшие расхождения могут не отражать существенных различий в возможностях.

Модель разработана лабораторией Alibaba Security AGI Lab под руководством Хуан Лунтао. Согласно отчету команды, базовая модель Qwen3.8-27B показала результат 54,51% в тех же условиях, таким образом, после обучения показатель увеличился на 34,39 процентных пункта. Лаборатория приписывает успех контролируемому дообучению на анонимизированных траекториях собственных операций безопасности Alibaba, агентному обучению с подкреплением в общей инструментальной среде, вознаграждениям, основанным на сборках, сбоях и проверке PoC, а также повторному использованию неудачных попыток в качестве пар для коррекционного обучения. Утверждается, что в процессе обучения не использовались задачи CyberGym, исправления или эталонные PoC. Оценка проводилась с использованием собственного FP8-инференса с контекстным окном 256 тыс. токенов, без предварительно установленных фреймворков фаззинга и с сетевым доступом, ограниченным белым списком бенчмарка.

Alibaba также делает ставку на эффективность. По данным компании, модель размером 27B в 27–370 раз меньше сопоставимых кибермоделей, что снизит вычислительные затраты на автоматизированную сортировку уязвимостей. Веса XekRung не были опубликованы, и Alibaba не назвала сроков предоставления внешнего доступа, хотя Хуан Лунтао заявил, что технологии безопасности лаборатории будут предлагаться более широко, а будущие версии будут нацелены на состязательный интеллект, самоэволюцию и агентные задачи. Более ранний технический отчет по XekRung в мае был посвящен версии 8B, построенной на базе Qwen.

СМОТРИТЕ ТАКЖЕ:Модель Zhipu GLM-5.3 для кодирования и безопасности · MopMonk в топ-7 CyberGym · Shanghai AI Lab Atria Dawn Preview

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: