Z.ai выпустила GLM-5.3: заметно сильнее в кодинге и неожиданно, в поиске уязвимостей

Z.ai выпустила GLM-5.3, новую версию своей флагманской модели для работы с кодом. В основе, по словам компании, та же базовая модель, что и у GLM-5.2: весь прирост качества дало постобучение (дополнительное обучение поверх уже готовой базовой модели), за последний месяц Z.ai продолжила наращивать масштаб обучения на уже накопленных агентных окружениях: больше окружений, больше типов задач, больше вычислений. Компания выделяет три момента: модель заметно сильнее в сложном кодинге и в долгих многошаговых задачах; у неё неожиданно резко выросли способности к поиску и эксплуатации уязвимостей; а веса модели Z.ai откроет, по формулировке в начале поста, через две недели после релиза, после завершения проверки безопасности и усиления защитных механизмов.

На закрытом внутреннем бенчмарке компании, Z.ai Code Bench, GLM-5.3 показывает прирост на 50% относительно GLM-5.2; по заявлению Z.ai, это делает её самой способной в кодинге моделью среди моделей с открытыми весами, а на публичных тестах Terminal-Bench 3.0 и Agents' Last Exam, лидером в той же категории. В цифрах по сравнению с GLM-5.2: Terminal Bench 2.1 выросла с 81.0 до 88.2 балла, Terminal-Bench 3.0, с 4.6 до 28.3, DeepSWE v1.1, с 46.2 до 66.9, Agents' Last Exam, с 23.8 до 28.5. При этом по данным той же сравнительной таблицы на части публичных тестов GLM-5.3 всё ещё уступает закрытым моделям: например, на DeepSWE v1.1 у Claude Fable 5 (в таблице, «Fable 5 (w/ fallback)») 69.7 балла, у GPT-5.6 Sol, 72.7, против 66.9 у GLM-5.3.

Z.ai также подчёркивает эффективность по токенам. На максимальном уровне усилий (Max) GLM-5.3 решает 34.5% задач Z.ai Code Bench, тратя около 75 тысяч токенов на задачу, тогда как GLM-5.2 показывала 23.4% при 96 тысячах токенов. На уровне High GLM-5.3 достигает 31.4% примерно на 50 тысячах токенов, выше результата Claude Opus 4.8, 29.5% при 120 тысячах токенов (источник не уточняет, на каком уровне усилий тестировался сам Opus 4.8). При этом GLM-5.3 всё ещё уступает Claude Fable 5, которая на максимальном уровне усилий показывает 39.5%, число токенов для этого результата в посте не приведено.

Второй, менее ожидаемый результат касается кибербезопасности. В процессе постобучения Z.ai добавила в тренировочный набор данные и окружения по поиску уязвимостей, рассчитывая просто улучшить способность модели находить и разбирать уязвимости. По словам компании, способность росла быстрее, чем они рассчитывали: GLM-5.3 не просто лучше находит отдельные изъяны в коде, а научилась рассуждать сразу о нескольких стадиях эксплуатации и выстраивать связные цепочки полной эксплуатации уязвимости. На CyberGym (поиск и подтверждение уязвимостей по открытому исходному коду) GLM-5.3 набирает 84.5% против 77.2% у GLM-5.2, лучший результат на бенчмарке, выше моделей Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%). На ExploitBench (более глубокое рассуждение о реальных уязвимостях и их эксплуатации) GLM-5.3 показывает 54.4%, более чем вдвое больше GLM-5.2 (24.4%), хотя Mythos 5 и GPT-5.6 Sol здесь всё ещё заметно впереди, 78.0% и 76.5% соответственно. На ExploitGym (число задач по эксплуатации, решённых в пересчитанном по времени бюджете) GLM-5.3 закрывает 105 задач за два часа и 130 за шесть против 29 и 39 у GLM-5.2, но Mythos 5 по-прежнему заметно впереди, 181 и 247 задач. Сама Z.ai видит здесь закономерность: чем ближе бенчмарк к финальным стадиям эксплуатации, тем больше прирост относительно GLM-5.2, и тем шире пока остаётся разрыв с моделями-лидерами закрытого класса. «Способности растут быстрее всего именно там, где мы отстаём сильнее всего», пишет команда Z.ai.

Компания проверила эти способности не только на бенчмарках. С момента выхода GLM-5.2 Z.ai сотрудничает с несколькими командами по информационной безопасности в Китае (их названия не раскрываются), прогоняя свои модели по реальным кодовым базам. После экспертной проверки, отсева и удаления дублей модели нашли 2436 уязвимостей в 269 проектах, 1097 из них, критической и высокой степени серьёзности. Находки охватывают ядра операционных систем, сами ОС, движки браузеров, открытую инфраструктуру, веб-приложения и сетевые протоколы; часть уязвимостей оставалась незамеченной годами и даже десятилетиями. Эти же 2436 находок Z.ai раскладывает по разным срезам в открытом Z.ai Security Disclosure Ledger (реестр раскрытия уязвимостей, cvd.z.ai): по статусу раскрытия, 53 уже опубликованы, 2383 пока под эмбарго; по возрасту, самая старая датируется 1981 годом, а в среднем уязвимость жила 26.6 года до обнаружения; по критичности, 107 критических, 990 высокой степени, 1286 средней и 53 низкой.

Всё это работает на slime, открытом фреймворке Z.ai для обучения с подкреплением (Megatron для тренировки, SGLang для роллаутов), который позволяет добавлять новые обучающие окружения, не переделывая сам цикл обучения. К релизу GLM-5.3 команда снизила расхождение между логарифмами вероятностей (logprob) на тренировке и роллауте более чем на 99.99% (до уровня 1e-7) и подняла сквозную пропускную способность RL-обучения для долгих кодинговых задач более чем в 2.3 раза, за счёт кэширования на диске, совместного планирования запросов и эвристик, подстраивающихся под конкретное окружение.

На практике GLM-5.3 уже роздана всем подписчикам GLM Coding Plan, который теперь считает использование в очках отдельно для входных, кэшированных входных и выходных токенов; вызовы вне часов пик (пик, будни, 14:00, 18:00 по UTC+8) обходятся вдвое дешевле по очкам. В API у модели теперь три уровня усилий на рассуждение, low, high и max (по умолчанию max, для кодинга он же и рекомендован); отключить рассуждение больше нельзя, если приложение раньше слало thinking.type «disabled», перед переходом на модель glm-5.3 нужно явно включить thinking и поставить reasoning_effort в low, иначе запросы начнут падать с ошибкой. Модель уже можно пробовать в кодинг-агентах: собственном ZCode от Z.ai, а также в Claude Code и OpenCode. Для ZCode компания заявляет частоту попаданий в кэш выше 98% (это должно давать примерно на 30% больше «эффективных» токенов за счёт более дешёвого повторного контекста) и временный буст квоты 1.5x, который вместе с экономией на кэше даёт до 180% стандартной квоты, акция действует до 31 августа (год в посте не указан). Веса модели Z.ai обещает выложить в открытый доступ: в начале поста, через две недели после релиза и по завершении проверки безопасности, а ниже, в разделе про локальный запуск, просто «через две недели», уже без этой оговорки.

Ключевые факты

  • Z.ai выпустила GLM-5.3, обновление на той же базовой модели, что и у GLM-5.2; весь прирост дало постобучение, а на закрытом Z.ai Code Bench результат вырос на 50% относительно GLM-5.2
  • На публичных бенчмарках: Terminal-Bench 3.0, с 4.6 до 28.3 балла, DeepSWE v1.1, с 46.2 до 66.9, Agents' Last Exam, с 23.8 до 28.5; по заявлению Z.ai, модель, лидер по кодингу среди моделей с открытыми весами
  • У модели неожиданно (по словам компании, «быстрее, чем мы рассчитывали») резко выросли способности искать и эксплуатировать уязвимости: CyberGym, с 77.2% до 84.5%, ExploitBench, с 24.4% до 54.4%, более чем вдвое
  • На реальных open-source проектах модели Z.ai вместе с ИБ-командами в Китае нашли 2436 уязвимостей в 269 проектах, 1097 из них, критической и высокой серьёзности; средний возраст уязвимости до обнаружения, 26.6 года
  • Веса GLM-5.3 Z.ai обещает выложить в открытый доступ примерно через две недели после релиза, в начале поста это увязано с завершением проверки безопасности, ниже по тексту та же дата повторена уже без этой оговорки

Почему это важно

Обычно про emergent capabilities, способности, которые прорастают у модели как будто в довесок к целевому обучению, говорят как о теоретическом риске ИИ-безопасности. Здесь конкретная компания описывает конкретный случай на своих собственных данных: обучая модель находить уязвимости (сама по себе полезная для защиты задача), Z.ai получила модель, которая заодно резко продвинулась в рассуждении о полных цепочках эксплуатации, не просто «нашёл дыру», а «понял, как именно ею воспользоваться». И это не гипотеза на будущее: модель открытая по классу весов (их обещают выложить в свободный доступ через пару недель), а её возможности уже проверены не только на бенчмарках, но и на реальном коде, 2436 находок в 269 проектах. Закономерность, которую заметила сама Z.ai («способности растут быстрее всего именно там, где мы отстаём сильнее всего»), означает, что по мере обучения кодингу разрыв с закрытыми моделями-лидерами быстрее всего сокращается именно в наступательных, а не в оборонительных сценариях.

Кому это важно

Разработчикам и командам, которые уже используют агентных кодинг-помощников, GLM Coding Plan, ZCode, Claude Code, OpenCode, им сразу доступно обновление с более сильным кодингом и лучшей эффективностью по токенам. Специалистам по безопасности и red-team-инженерам, как инструмент для поиска уязвимостей в собственном коде, тем более что Z.ai уже показала практический результат на реальных проектах. Мейнтейнерам открытых проектов, их код мог попасть в число 269 просканированных, а после публикации весов такие сканирования смогут проводить уже произвольные третьи стороны. И тем, кто следит за политикой безопасности ИИ и темой emergent capabilities, это конкретный, задокументированный самой компанией пример на открытой модели, а не гипотетический сценарий.

Как это применить

GLM-5.3 уже роздана всем подписчикам GLM Coding Plan и доступна в кодинг-агентах ZCode, Claude Code и OpenCode. В API у модели теперь три уровня усилий на рассуждение, low, high, max (по умолчанию max, для кодинга он же и рекомендован Z.ai); отключить рассуждение больше нельзя, и если приложение раньше слало thinking.type «disabled», перед переходом на модель glm-5.3 нужно явно включить thinking и поставить reasoning_effort в low, иначе запросы начнут падать с ошибкой. GLM Coding Plan считает использование в очках, отдельно для входных, кэшированных входных и выходных токенов; вызовы вне часов пик (будни, 14:00, 18:00 по UTC+8) обходятся вдвое дешевле. В ZCode отдельно заявлена частота попаданий в кэш выше 98% (даёт примерно на 30% больше «эффективных» токенов) и временный буст квоты 1.5x, который вместе с экономией на кэше даёт до 180% стандартной квоты, акция идёт до 31 августа. Тем, кто хочет запускать модель у себя, придётся подождать: веса Z.ai обещает выложить в открытый доступ примерно через две недели после релиза.

Можно ли доверять

Почти все цифры в посте, оценка самой Z.ai на собственных или частично собственных бенчмарках; независимой стороной в сравнительной таблице помечены только два ряда: FrontierSWE (оценивала компания Proximal) и GDPval-AA v2 (оценивала Artificial Analysis). Остальные результаты, включая все показатели по кибербезопасности и находку 2436 уязвимостей на реальном коде, получены и опубликованы самой Z.ai и её неназванными партнёрами по инфобезопасности в Китае. У поста при этом есть внутренние нестыковки. Возраст самой старой найденной уязвимости назван дважды по-разному: в основном тексте, «около 40 лет», а в отдельной сводке чуть ниже, «введена в 1981 году», то есть примерно 45 лет; источник это противоречие не поясняет. Число 1097, которое в основном тексте названо «от средней до высокой степени серьёзности», в панели статистики подписано иначе, «CRITICAL & HIGH», и совпадает именно с суммой критических (107) и высоких (990) находок из отдельно приведённой разбивки, а не со средними (их отдельно указано 1286); источник и это несоответствие не комментирует. Обещание открыть веса модели в начале поста снабжено условием («после завершения проверки безопасности»), а в разделе про локальный запуск то же обещание, «через две недели», повторено уже без этого условия. Отдельно стоит модель, которую пост называет Mythos 5: все три её результата по кибербезопасности (CyberGym, ExploitBench, ExploitGym) в точности совпадают с колонкой «Fable 5 (w/ fallback)» в сравнительной таблице, но сам пост нигде не говорит прямо, что это одна и та же модель, что именно скрывается за именем Mythos 5, по тексту не установить.

Риски и подводные камни

Главный риск, двойное назначение самой способности: открытая по весам модель, которая, по данным Z.ai, резко продвинулась в построении полных цепочек эксплуатации уязвимостей, а веса компания обещает выложить в свободный доступ примерно через две недели. После публикации весов пользоваться моделью, в том числе для наступательных сценариев, а не только для поиска и устранения уязвимостей, сможет кто угодно. Единственная описанная мера, «проверка безопасности и усиление защитных механизмов» перед публикацией весов, но что именно она проверяет и что может стать причиной задержки или отмены публикации, в посте не раскрывается. Партнёрство по поиску уязвимостей на реальном коде компания ведёт с несколькими командами по инфобезопасности в Китае, но их названия не раскрыты, так что независимо оценить, как именно проверяются находки, нельзя. Отдельный практический риск, для существующих интеграций через API: если приложение продолжит слать thinking.type «disabled» уже после перехода на glm-5.3, не выполнив миграцию заранее, запросы начнут завершаться ошибкой. И акции по квоте ZCode (буст 1.5x, в сумме до 180% стандартной квоты) прямо ограничены по времени, действуют до 31 августа, так что условия могут измениться вскоре после публикации поста.

«Способности растут быстрее всего именно там, где мы отстаём сильнее всего.»

— команда Z.ai