GLM-5.3 выходит всего через несколько часов после «sooooooon» Тан Цзе — модель Zhipu для кодинга и безопасности удваивает результат в SWE-Marathon и возглавляет CyberGym

Zhipu Ai Glm-5.3 программирование безопасность ии бенчмарки pandaily.com

Через три дня после подкола пользователя X в адрес главного научного сотрудника Zhipu AI Тан Цзе о GLM-5.3 он ответил «sooooooon», и через несколько часов модель вышла. Сфокусированная исключительно на программировании и безопасности, GLM-5.3 более чем удвоила SWE-Marathon до 42,5, в пять раз увеличила Terminal Bench 3.0 до 28,3 и набрала 84,5 на CyberGym, заняв первое место среди всех моделей.

Три дня назад пользователь на X поддразнил главного научного сотрудника Zhipu AI Тан Цзе, что его «скоро» равняется «на следующей неделе» Илона, спросив, когда выйдет GLM-5.3. Сегодня утром Тан Цзе ответил одним словом: sooooooon. Комментаторы пошутили, что это очередная дымовая завеса, ожидая как минимум месяц ожидания. Несколько часов спустя GLM-5.3 был официально выпущен, а технический блог Z.ai заработал в прямом эфире. От твита до релиза за несколько часов — редкость в мире больших моделей; возможно, это самое быстрое sooooooon из когда-либо выполненных.

Позиционирование GLM-5.3 резко сфокусировано: не универсал, а программирование и безопасность, доведенные до крайности. В программировании главное — масштаб улучшения. SWE-Marathon вырос с 19,4 до 42,5, а FrontierSWE — с 67,5 до 78,1. На Terminal Bench 3.0, который симулирует многошаговые операции в реальном Linux-терминале, GLM-5.2 набрал 4,6, тогда как GLM-5.3 достиг 28,3 — пятикратный скачок. Базовая модель того же поколения с тем же количеством параметров добилась прироста исключительно за счет пост-тренинга.

Безопасность — более привлекающая внимание часть. Бенчмарк CyberGym тестирует не написание безопасного кода, а поиск и эксплуатацию уязвимостей, играя роль белого хакера: выявление дыр, построение атак и проверка эффектов. GLM-5.3 набрал 84,5, заняв первое место среди всех оцененных моделей. Z.ai также опубликовала реестр раскрытий безопасности: 2 436 находок в области безопасности в 269 проектах с открытым исходным кодом, из которых 1 097 были критическими или высокой степени серьезности. Самая старая уязвимость датировалась 1981 годом, и в среднем каждая существовала в коде 26,6 лет до обнаружения, что ярко иллюстрирует проблему, которую традиционные аудиты, ограниченные человеческими возможностями перед лицом экспоненциально растущего кода, не могут охватить.

Возможности агента также продвигаются. GLM-5.3 вводит механизм Effort Level, предлагающий четыре уровня глубины рассуждений от Non-Thinking до Max. Официальные кривые показывают рост точности с примерно 24,5% на Low до 34,5% на Max — крутой наклон, в то время как кривая GLM-5.2 почти плоская, поднимаясь с примерно 20% до 23,5%. На агентских бенчмарках GLM-5.3 показывает Toolathlon Verified 73,0, AutomationBench 48,2, Agents’ Last Exam 28,5, HLE with Tools 62,5 и GDPVal-AA v2 1769 — все в первом эшелоне.

Zhipu также раскрыла, что следующая крупная версия перейдет на совершенно новую архитектуру с удвоенными параметрами, нацеленную на Fable 5 по всем направлениям. Если так, то GLM-5.3 читается как антракт перед более крупным релизом. История со «скоро» имеет вторую половину: сегодня кто-то спросил Тан Цзе о GLM-6 на X, и его ответ снова был soon. То же слово, во второй раз, но на этот раз больше людей решают поверить, потому что несколькими часами ранее то же самое «скоро» только что было выполнено.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: