Z.ai выпустила модель GLM-5.3 в открытом доступе

Z.ai выпустила модель GLM-5.3 в открытом доступе

Компания Z.ai (организация zai-org на Hugging Face) выложила в открытый доступ веса модели GLM-5.3. В карточке модели прямо сказано: GLM-5.3 использует ту же базовую модель, что и GLM-5.2, весь прирост качества получен исключительно за счёт пост-обучения, без изменения архитектуры или масштаба предобучения. По заявлению разработчиков, по сравнению с GLM-5.2 новая версия заметно лучше справляется со сложными задачами программирования и с длинными, многошаговыми (long-horizon) заданиями, где модели нужно удерживать контекст и план действий на протяжении многих шагов.

Модель поддерживает запуск через несколько популярных инструментов: библиотеку Transformers (обычный pipeline или прямая загрузка через AutoModelForCausalLM), серверы vLLM и SGLang с OpenAI-совместимым API, Docker Model Runner, а также специализированные фреймворки для процессоров Ascend (китайские NPU), vLLM-Ascend, xLLM и SGLang.

Из настроек модели в карточке выделены два параметра. Reasoning_effort принимает три значения, low, high и max, и по умолчанию (или при любом некорректном значении) выставляется в max; для более быстрых ответов low/high нужно указывать явно. Параметр clear_thinking по умолчанию выключен (false), но для обычных чат-сценариев разработчики рекомендуют явно включать его (true).

Карточка подробно описывает методологию нескольких оценочных тестов, но не приводит сами числовые результаты GLM-5.3 в открытом тексте, видны только настройки прогонов. В части тестов в роли модели-судьи использовалась GPT-5.6-luna (medium уровень рассуждений). Один из бенчмарков прогонялся при максимальной длине генерации 163 840 токенов и контексте до 300 000 токенов; в других агентных тестах на кодинг использовался контекст до 1 миллиона токенов. Есть тест на 1507 задач (Pass@1, один прогон), тест на 869 задач с двумя бюджетами времени, 2 и 6 часов, и отдельный тест на 41 задачу с усреднением по 3 ревизиям и лимитом в 300 раундов взаимодействия агента со средой. Для честности сравнения время API-инференса пересчитывалось по скорости генерации модели (данные Artificial Analysis): GLM-5.3, 115 токенов в секунду, Kimi K3, 40, Qwen3.8 Max, 47. Чтобы агент не мог «жульничать» во время тестов, авторы применяли белый список разрешённых доменов (например, pypi.org и deb.debian.org, только для установки зависимостей) и отдельную проверку решений на использование сторонних API.

Релиз сопровождается техническим отчётом «GLM-5: from Vibe Coding to Agentic Engineering» (arXiv:2602.15763, 2026 год) с очень широким списком соавторов, объединённых как GLM-5-Team.

Ключевые факты

  • Z.ai открыла веса GLM-5.3 на Hugging Face; базовая модель та же, что у GLM-5.2, весь прирост, от пост-обучения
  • По заявлению разработчиков, модель заметно сильнее GLM-5.2 в сложном кодинге и длинных многошаговых задачах
  • Поддерживается запуск через Transformers, vLLM, SGLang, Docker Model Runner и фреймворки для NPU Ascend
  • Настраиваемые параметры: reasoning_effort (low/high/max, по умолчанию max) и clear_thinking (по умолчанию выключен)
  • Карточка модели описывает методологию нескольких агентных кодинг-бенчмарков (сотни, полторы тысячи задач, тайминги до 6 часов, антимошеннический белый список доменов), но конкретных числовых результатов в видимом тексте нет

Почему это важно

GLM-5.3, заметный пример того, что прирост качества открытой модели можно получать не через новое, более крупное предобучение, а через пост-обучение поверх той же базовой модели. Для рынка открытых весов это отдельный, более дешёвый путь развития, и делают его китайские разработчики, которые в последний год выпускают такие модели особенно активно.

Кому это важно

В первую очередь разработчикам, которые строят кодинг-агентов и системы для долгих многошаговых задач: именно в этих сценариях модель, по словам создателей, дала наибольший прирост. Также важно инженерам, которые самостоятельно разворачивают открытые модели, поддержаны основные серверные фреймворки (vLLM, SGLang) и, отдельно, экосистема китайских NPU Ascend.

Как это применить

Модель можно запустить локально или на сервере через Transformers, vLLM, SGLang или Docker Model Runner с OpenAI-совместимым API, примеры команд приведены прямо в карточке модели. При интеграции стоит явно задавать reasoning_effort (low/high/max) под нужный баланс скорости и качества рассуждений и включать clear_thinking=true для обычного чат-режима.

Можно ли доверять

Источник, официальная карточка модели на Hugging Face от самой Z.ai, ей можно доверять как первоисточнику. Но в видимом тексте карточки нет ни одной конкретной цифры точности или места в рейтингах, только описание методологии тестов (какие тайминги, какой контекст, какая модель-судья, какие меры против жульничества агента). Сами результаты, судя по всему, приведены в сопроводительном техническом отчёте на arXiv, а не в тексте карточки.

Риски и подводные камни

В карточке модели нет ни числа параметров, ни точной даты релиза (кроме года 2026 у цитируемой статьи), ни условий лицензии и цены использования, эти детали стоит уточнять отдельно перед коммерческим применением. Формулировка «open-weight» из заголовка обсуждения на Hacker News не встречается дословно в тексте самой карточки модели. Стоит учитывать и то, что сравнение скорости моделей по токенам в секунду для пересчёта таймингов теста, методологический выбор авторов, который может влиять на итоговые цифры сравнения.