GLM 5.2 от Z.ai впятеро дешевле Opus 4.8, но проигрывает в сложном кодинге

Зейн Хасан, AI-инженер компании Together AI, приучил себя выбирать модель под задачу с оглядкой на цену: сложные проблемы он отправляет фронтир-модели, например, кодинговой Fable от Anthropic, а более простые задачи поручает более дешёвой и менее мощной модели. Сейчас в роли такой дешёвой модели у него выступает GLM 5.2, открытая модель, выпущенная 16 июня пекинской лабораторией Z.ai под лицензией MIT. Скачать и развернуть её на своих серверах может любая организация с достаточными вычислительными мощностями. Для тех, кто пользуется API Z.ai, цена тоже ниже: $4,40 за миллион выходных токенов, это меньше пятой части цены доступа к Opus 4.8 от Anthropic и десятая часть цены кодинговой модели Fable. По словам Хасана, многие компании пока не считают токенный бюджет всерьёз: «Многие компании сейчас всё ещё пытаются разобраться с этой технологией, и поэтому у них по сути нет бюджета на токены». Когда счёт оплачивает работодатель, инженеры просто берут самую мощную модель, и эта привычка «цена не имеет значения», по мнению автора материала, сейчас остаётся главным защитным рвом американских фронтир-лабораторий.
GLM 5.2, модель на 753 млрд параметров, из которых одновременно активны только 40 млрд (это ускоряет генерацию ответа). Релиз добавил тревоги о том, что американские ИИ-компании могут терять технологическое лидерство: GLM 5.2 почти сравнялась с Opus 4.8 по очкам в ряде агентных бенчмарков кодинга, например FrontierSWE и PostTrainBench, а также показала хорошие результаты в тестах по кибербезопасности, это вызвало сравнения с моделью Anthropic Mythos. По данным ежегодного обзора Stanford AI Index, в 2025 году китайские компании выпустили чуть больше половины от числа «заметных» ИИ-моделей США, против примерно трети в 2023-м и пятой части в 2020-м. GLM 5.2 установила новые рекорды как среди открытых моделей, так и среди китайских моделей в целом. Открытые веса дают выход организациям, которые опасаются направлять чувствительные данные через связанную с Китаем инфраструктуру: модель можно развернуть на собственном оборудовании, чего нет у большинства фронтир-моделей, доступных только через закрытый API.
Сама Z.ai в день релиза опубликовала исследовательский отчёт с собственными цифрами. В нём нет сравнения с Mythos и Fable, на момент публикации они были анонсированы, но ещё не выпущены публично; отчёт сравнивает GLM 5.2 с Opus 4.8 от Anthropic и GPT-5.5 от OpenAI. GLM 5.2 часто показывает результат, близкий к Opus 4.8, но, по признанию самого отчёта, выигрывает лишь в двух менее сложных бенчмарках на рассуждение, и ни в одном из бенчмарков кодинга. По многим другим бенчмаркам GLM 5.2 уступает Opus 4.8 (а иногда и GPT-5.5) в агентном кодинге: в сложном долгом бенчмарке SWE-Marathon GLM 5.2 выполнила лишь 13% задач, а Opus 4.8 набрала вдвое больше очков. Opus 4.8 также выигрывает с разрывом от 10 процентных пунктов и выше в бенчмарках NL2Repo, DeepSWE и Tool-Decathlon.
Отзывы разработчиков, испытавших GLM 5.2 на своих рабочих процессах, расходятся. Хасан отметил, что модель заметно лучше справляется с долгими задачами: ранние открытые модели теряли нить разговора после 5, 15 обменов репликами, а с GLM 5.2, по его словам, можно работать часами и получать связный ход мысли; он также похвалил «действительно хороший вкус» модели в веб-дизайне. Дэвид Никс, ведущий инженер-программист компании MetaRouter (Денвер), использующий LLM и на основной работе, и в личных проектах, сказал, что GLM 5.2 подходит «действительно близко» к фронтир-моделям вроде Opus и GPT-5.5, настолько близко, что заняла постоянное место в его ротации моделей. По его оценке, GLM 5.2 берёт на себя 10, 20% его повседневных задач для LLM и стала первым выбором для конкретных задач вроде фронтенд-дизайна, где модель особенно сильна. Кацпер Михалик, инженер-программист краковской компании Screen Studio, остался доволен результатами GLM 5.2 при создании веб-форм и не столкнулся с заметными проблемами качества, хотя изредка упирался в лимиты бесплатного тарифа. Иначе сложилось у Сая Кирана Мьядарама, инженера-программиста бангалорской компании Indhic AI: он оформил подписку в неделю запуска GLM 5.2 и обнаружил, что недельная квота токенов исчерпывается меньше чем за два-три дня; кроме того, он столкнулся с галлюцинациями модели и избыточным «переусложнением» плана при мелких правках фронтенда, «она портит мою кодовую базу», после чего вернулся к Codex от OpenAI.
Ключевые факты
- GLM 5.2 от Z.ai (Пекин) вышла 16 июня как открытая модель под лицензией MIT: 753 млрд параметров, из них активны только 40 млрд одновременно.
- API Z.ai стоит $4,40 за миллион выходных токенов, меньше пятой части цены Opus 4.8 от Anthropic и десятая часть цены кодинговой модели Fable.
- GLM 5.2 почти догоняет Opus 4.8 в части бенчмарков (FrontierSWE, PostTrainBench, кибербезопасность), но в сложных агентных тестах заметно уступает: 13% в SWE-Marathon против вдвое большего результата Opus 4.8, отставание на 10+ пунктов в NL2Repo, DeepSWE и Tool-Decathlon.
- По данным Stanford AI Index, доля «заметных» ИИ-моделей китайских компаний относительно США выросла с пятой части (2020) и трети (2023) до чуть более половины (2025).
- Отзывы разработчиков разделились: одни хвалят модель за долгие связные диалоги и веб-дизайн, другие жалуются на быстро исчерпываемую квоту, галлюцинации и порчу кодовой базы.
Почему это важно
GLM 5.2 показывает, что открытые китайские модели сокращают разрыв с американскими фронтир-лабораториями не столько по чистой мощности, сколько по соотношению цена/качество: модель почти дотягивается до Opus 4.8 на части бенчмарков при цене в разы ниже. Материал прямо называет это угрозой главному защитному рву фронтир-лабораторий, привычке инженеров не считать токенный бюджет и брать самую мощную модель по умолчанию.
Кому это важно
Инженерам и компаниям, которые платят за LLM-инференс и хотят снизить издержки на рутинные кодинговые задачи; организациям, для которых важна возможность самостоятельного хостинга модели из соображений контроля над данными (открытые веса позволяют не отправлять данные через инфраструктуру, связанную с Китаем); командам, много работающим с агентным и фронтенд-кодингом.
Как это применить
Рабочая стратегия, которую уже применяет часть инженеров из материала: сложные и долгие задачи, фронтир-модели (Opus, Fable, GPT-5.5), рутинные и фронтенд-задачи, более дешёвая GLM 5.2. Благодаря открытым весам и лицензии MIT модель можно развернуть на собственном оборудовании вместо использования API Z.ai. При этом стоит закладывать запас по квоте: у одного из пользователей недельный лимит платного тарифа исчерпался меньше чем за три дня.
Можно ли доверять
Данные смешанные и не в пользу однозначного превосходства GLM 5.2. Собственный отчёт Z.ai, опубликованный в день релиза, сравнивает модель только с уже доступными на тот момент Opus 4.8 и GPT-5.5 (обходя стороной ещё не выпущенные Fable и Mythos) и сам признаёт победу лишь в двух менее сложных бенчмарках на рассуждение, ни одной, в кодинге. По ряду независимо упомянутых сложных агентных бенчмарков (SWE-Marathon, NL2Repo, DeepSWE, Tool-Decathlon) GLM 5.2 заметно отстаёт от Opus 4.8. Живые отзывы разработчиков в материале также расходятся, от восторженных до резко негативных.
Риски и подводные камни
Один из опрошенных инженеров сообщил о галлюцинациях и избыточном «переусложнении» плана модели при мелких правках фронтенда, вплоть до порчи кодовой базы, и в итоге вернулся к Codex от OpenAI. Подписной тариф Z.ai может исчерпывать недельную квоту токенов за два-три дня. Использование API Z.ai напрямую (а не самостоятельный хостинг) означает маршрутизацию данных через связанную с Китаем инфраструктуру, что может быть неприемлемо для организаций с чувствительными данными.
«Многие компании сейчас всё ещё пытаются разобраться с этой технологией, и поэтому у них по сути нет бюджета на токены.»
— Зейн Хасан, AI-инженер Together AI