Z.ai выпустила GLM-5.3-Flash: в 10 раз дешевле GLM-5.2, почти как Claude Opus 4.8
Компания Z.ai выпустила GLM-5.3-Flash, первую нативно мультимодальную модель в линейке GLM-5. У модели 320 млрд параметров всего и только 18 млрд активных; по заявлению компании, она превосходит предыдущую GLM-5.2 по бенчмаркам и реальным рабочим нагрузкам при цене в десять раз ниже, а по кодингу и агентным задачам приближается к Claude Opus 4.8.
На индексе интеллекта Artificial Analysis (v4.1.1) GLM-5.3-Flash набрала 57 баллов при стоимости $0,045 за задачу (со скидкой), по словам Z.ai, раньше такой уровень интеллекта был доступен примерно в 10 раз дороже. На шести кодинговых и агентных бенчмарках модель стабильно обходит GLM-5.2, местами с большим отрывом: 63,4 против 46,2 на DeepSWE v1.1 и 48,8 против 26,2 на AutomationBench. На собственном тесте Z.ai Code Bench v1.0 (прогон на Claude Code 2.1.207) при максимальном уровне рассуждений GLM-5.3-Flash почти сравнялась с Claude Opus 4.8, 29,0 против 29,5 балла. На Terminal Bench 2.1 у неё 84,3 балла (у GLM-5.2, 81, у Opus 4.8, 85), а на Toolathlon Verified GLM-5.3-Flash даже обошла Opus 4.8: 78,4 против 76,2.
Эффективность обеспечена архитектурными изменениями. По сравнению с линейкой GLM-4.5 у новой модели сопоставимое общее число параметров (320 млрд против 355 млрд), но активных параметров и слоёв почти вдвое меньше (18 млрд против 32 млрд, 45 слоёв против 92). Модель впервые сочетает разреженное и линейное внимание в гибридной архитектуре: линейное внимание отвечает за локальные зависимости, разреженное, извлекает релевантный глобальный контекст через лёгкий индексатор. Для контекста длиной до 1 млн токенов добавлен механизм IndexPool, который сжимает четыре вектора ключей индексатора в один методом взвешенного пулинга. Также применена техника Manifold-Constrained Hyper-Connections (mHC) для эффективности масштабирования, а предобучение прошло на корпусе из 30 трлн мультимодальных токенов. По сравнению с GLM-5.3 новая версия снижает затраты на вычисление внимания в 3,0 раза, а размер KV-кэша, в 4,4 раза; впрочем, сам KV-кэш всё ещё немного больше, чем у моделей Kimi-K3 и DeepSeek-V4-Flash, и Z.ai признаёт здесь резерв для дальнейшего улучшения.
Z.ai также рассказала об обслуживании модели на кластере китайских ИИ-чипов: для этой архитектуры построен отдельный инференс-движок поверх SGLang, а сама GLM-5.3 (в роли инфраструктурного агента) помогала инженерам оптимизировать ядра и диагностировать узкие места, по формулировке компании, «модель помогала оптимизировать систему, которая обслуживает саму модель». По сравнению с изначальным вариантом на том же оборудовании производительность обслуживания выросла в 3 раза, а эффективность и стоимость на токен, по заявлению Z.ai, сравнялись с типичными GPU NVIDIA. Ещё до официального релиза модель без огласки тестировалась под именем «ox-alpha» на платформах OpenCode и OpenRouter и, по словам компании, быстро стала самой популярной моделью недели, весь этот трафик обслуживался именно китайскими чипами.
GLM-5.3-Flash уже доступна всем пользователям подписки GLM Coding Plan и даёт втрое больше полезной квоты по сравнению с GLM-5.3. Мультимодальные возможности, в том числе функции Browser Use и Computer Use, где агент кликает по веб-страницам с визуальной проверкой и управляет приложениями на компьютере, открываются в среде ZCode. Веса модели опубликованы в открытом доступе на Hugging Face; для локального развёртывания уже поддерживаются фреймворки SGLang, vLLM и TokenSpeed, поддержка остальных обещана позже.
Ключевые факты
- GLM-5.3-Flash, первая нативно мультимодальная модель линейки GLM-5 от Z.ai: 320 млрд параметров всего, 18 млрд активных
- По заявлению Z.ai, модель обходит предыдущую GLM-5.2 по бенчмаркам и рабочим задачам при цене в 10 раз ниже
- На собственном тесте Z.ai Code Bench v1.0 при максимальных усилиях модель почти сравнялась с Claude Opus 4.8 (29,0 против 29,5 балла), а на Toolathlon Verified обошла его (78,4 против 76,2)
- Гибридная архитектура (линейное + разреженное внимание, IndexPool, mHC) снижает вычисления внимания в 3 раза и размер KV-кэша в 4,4 раза относительно GLM-5.3
- Веса открыты на Hugging Face, поддерживаются SGLang/vLLM/TokenSpeed; модель также доступна в GLM Coding Plan (втрое больше квоты) и обслуживалась на кластере китайских ИИ-чипов
Почему это важно
GLM-5.3-Flash показывает, что почти фронтирный уровень качества можно получить сильно дешевле: за счёт гибридного внимания и вдвое меньшего числа активных параметров и слоёв модель приближается к Claude Opus 4.8 по кодингу и агентным задачам при заявленной цене на порядок ниже собственной предыдущей модели. Отдельная линия сюжета, обслуживание модели на кластере китайских ИИ-чипов с производительностью, которую Z.ai описывает как сопоставимую с типичными GPU NVIDIA: это заявка на то, что китайская чиповая инфраструктура готова к промышленному инференсу фронтирных моделей.
Кому это важно
Разработчикам, использующим кодинг-агентов и подписку GLM Coding Plan, им сразу доступна модель с увеличенной квотой. Компаниям, считающим стоимость инференса при масштабировании ИИ-агентов и длинного контекста. Тем, кто следит за экосистемой открытых моделей и китайских ИИ-чипов, как за альтернативой NVIDIA-инфраструктуре.
Как это применить
Модель уже включена в подписку GLM Coding Plan (даёт втрое больше полезной квоты по сравнению с GLM-5.3), доступна в среде ZCode с функциями Browser Use и Computer Use для агентной работы с браузером и десктопом. Для самостоятельного развёртывания веса опубликованы в открытом доступе на Hugging Face и уже поддерживаются инференс-фреймворками SGLang, vLLM и TokenSpeed; поддержка других фреймворков обещана позже.
Можно ли доверять
Все цифры в объявлении, собственные бенчмарки и измерения Z.ai, без независимой верификации в источнике; сравнения с GLM-5.2 и Claude Opus 4.8 подобраны и представлены самой компанией. При этом Z.ai не только хвалит модель: компания прямо признаёт, что размер KV-кэша у GLM-5.3-Flash всё ещё немного больше, чем у конкурирующих Kimi-K3 и DeepSeek-V4-Flash, и называет это зоной для доработки, такое признание слабости повышает доверие к остальным заявлениям.
Риски и подводные камни
Улучшение не универсально: на бенчмарке SimpleQA у базовой версии GLM-5.3-Flash результат ниже, чем у предыдущей GLM-5-Base (33,5 против 36 баллов), то есть выигрыш в цене и в кодинговых/агентных задачах не означает превосходства по всем метрикам сразу. Заявления об эффективности на китайских ИИ-чипах и об их сопоставимости с GPU NVIDIA по стоимости на токен опираются только на собственные измерения Z.ai, без сторонней проверки и без указания конкретных цифр в долларах.
«Ещё до релиза мы тестировали GLM-5.3-Flash без объявления, под именем «ox-alpha», на платформах OpenCode и OpenRouter, чтобы собрать отклики пользователей. Модель быстро стала самой популярной за неделю, и весь этот трафик обслуживался китайскими ИИ-чипами.»
— Z.ai, в блоге компании