Kimi K3 и GLM-5.3 почти сравнялись с лучшими моделями Запада

Полтора года назад релиз китайской модели DeepSeek R1 обвалил рынки: она неожиданно конкурировала с моделью o1 от OpenAI, первой коммерческой «рассуждающей» моделью, и, как сообщалось, обошлась разработчикам заметно дешевле. За несколько дней рынки потеряли миллиарды долларов капитализации. Но картина тогда была сложнее заголовков: по собственному отчёту DeepSeek, модель R1 обгоняла o1 на отдельных тестах вроде AIME 2024, но заметно отставала на других, например, в тесте фактических знаний SimpleQA. Более поздние бенчмарки выявили и другие пробелы: китайские модели вырывались вперёд по отдельным дисциплинам, но не по всем сразу. Ещё в конце июня, когда редакция THE DECODER начинала готовить этот материал, модель GLM-5.2 от Z.ai всё ещё соответствовала той же картине.
Затем один за другим вышли новые китайские модели с открытыми весами: Kimi K3 от Moonshot, Qwen3.8-Max от Alibaba и GLM-5.3 от Z.ai. Они разом оказались у вершины почти всех крупных и требовательных тестов: куда надёжнее предшественников справляются с продолжительными задачами на знания, многошаговым кодом и координацией инструментов. Разрыв, о котором ещё недавно говорили как о «нескольких месяцах», по большинству бенчмарков сжался настолько, что стал проблемой для инвесторов: по данным Wall Street Journal, перед предстоящим IPO компании Anthropic приходится отвечать на неудобные вопросы и в свою защиту указывать на оставшееся лидерство на самом верху рейтингов. Ниже этого верхнего эшелона рынок практически принадлежит открытым и значительно более дешёвым китайским моделям. Инвесторов беспокоит, что сама по себе производительность модели уже почти не может быть основой бизнеса: то, что сегодня умеет только одна модель, через несколько месяцев умеет и модель, доступная для бесплатного скачивания.
Западные лаборатории выдвигают два обвинения против китайских разработчиков. Первое, дистилляция: китайские компании якобы массово использовали западные модели как «учителей» при обучении своих. Второе, «бенчмаксинг»: модели якобы настраивают специально под конкретные тесты, не подтягивая реальные широкие возможности до того же уровня. При этом, по формулировке издания, американское лидерство не исчезло, но отступило к нескольким всё более узким участкам «фронтира», переднего края технически возможного. Собственный тезис THE DECODER: виновны китайские лаборатории в дистилляции или нет, вывод один и тот же, лидерство, которое держится только на самой модели, защитить нельзя. Конкурентное преимущество, считает редакция, всё меньше зависит от конкретной модели и всё больше, от системы вокруг неё, то есть от организации, которая непрерывно производит следующие модели.
В индексе Intelligence Index от Artificial Analysis модель Kimi K3 на старте заняла третье место с 57 баллами, сразу за тогдашними лидерами GPT-5.5 и Opus 4.8, а по бенчмарку AutomationBench-AA ненадолго вышла на первое место, пока Anthropic не ответила моделью Opus 5: та вернула себе вершину индекса с 61 баллом, отрыв всего в 4 балла от K3. На CEO-Bench, где агент управляет вымышленной софтверной компанией на протяжении 500 смоделированных дней, K3 показала лучший опубликованный результат, $22,15 млн, тогда как китайские модели, включая предшественницу K2.7, раньше регулярно проваливали такие длинные прогоны; похожего высокого уровня достигает и Qwen3.8-Max. Оговорка: новые китайские модели иногда тратят заметно больше токенов, чем западные, что частично съедает их ценовое преимущество, расчёт стоимости за решённую задачу по-прежнему играет роль.
Грань возможностей современных моделей уже давно растёт неравномерно, это явление исследователи называют «зазубренным фронтиром» (в оригинале, jagged frontier): отдельные способности прогрессируют с разной скоростью, поэтому тот самый растиражированный разрыв «в несколько месяцев» всегда зависел от того, кто и что именно измерял. Новость в другом, в том, где вообще ещё можно измерить лидерство Запада. Таких направлений редакция насчитала три.
Первое, абстрактные тесты специального назначения. На тесте абстрактного распознавания паттернов ARC-AGI-1 модель K3 и Fable 5, флагманская линейка Anthropic для кода и агентной работы, идут практически вровень: 94,5% против 98,5%. А вот на усложнённом ARC-AGI-2 разрыв расширяется заметно: 60,4% против 89,2%. Но ARC-AGI намеренно измеряет абстрактное мышление, далёкое от повседневных задач, и нет гарантии, что этот разрыв вообще что-то предсказывает на практике, экономически он вполне может остаться неважным.
Второе направление, надёжность. Новый бенчмарк AA-AnalystAgent (запущен 12 августа) проверяет агентный анализ данных на реальных таблицах и документах по метрике pass^5: задача засчитывается решённой, только если модель решает её верно во всех пяти независимых попытках. Здесь лидирует Opus 5 с 54%, за ней GPT-5.5 с 50%, а K3, лучшая среди открытых моделей, держит 39%. Но разрыв почти целиком объясняется нестабильностью, а не силой: хотя бы один раз из пяти попыток K3 решает 73% задач, почти вровень с Opus 5 (74%). Надёжность вообще не следует привычным местам в рейтингах интеллекта: даже GPT-5.6 Sol здесь отстаёт от собственной предшественницы GPT-5.5. Коммерчески это важно: агент-аналитик экономит время только тогда, когда его ответам можно доверять без перепроверки, а многократные прогоны и проверки решают проблему ценой роста стоимости каждого принятого результата.
Третье и самое задокументированное направление, наступательная кибербезопасность. Совместная оценка британского института AI Safety Institute (AISI) и американского CAISI показала, что K3 сильно отстаёт от ведущих американских моделей: на тесте разработки эксплойтов ExploitBench у неё 32% против примерно 76% в среднем у топовых американских моделей; из 41 задачи, где нужно выполнить код на целевой системе, она не решила ни одной, тогда как ведущие модели решают в среднем 20; в смоделированной атаке она остановилась на 17-м шаге из 32, тогда как ведущие модели в среднем доходят до шага 28,5. Но и этот разрыв быстро сокращается: GLM-5.3 (представлена 14 августа) набирает на ExploitBench 54,4% по собственным замерам Z.ai, более чем вдвое больше показателя предыдущей модели GLM-5.2, и за месяц сократила отставание от американских лидеров примерно вдвое; на тесте поиска и подтверждения уязвимостей в исходном коде CyberGym GLM-5.3 даже обгоняет ведущие американские модели.
При этом кибербезопасность, единственная область, где разработчики намеренно не продают свои сильнейшие возможности открыто. Лучшая киберспециализированная модель Anthropic, Mythos 5, показывает на ExploitBench 78%, но доступна только в контролируемом режиме через программу Project Glasswing; её публичный аналог, модель Fable 5, фактически остаётся на уровне старой Opus 4.8 (40%), потому что вышестоящие защитные механизмы перехватили 407 из 410 тестовых эпизодов. OpenAI действует похоже, через модель Daybreak и специализированные киберверсии: публичная GPT-5.6 Sol набирает на ExploitBench 73,5% по собственной оценке OpenAI, но остаётся ниже уровня Critical, высшей ступени шкалы риска компании. С будущей моделью Astra OpenAI впервые не может исключить, что порог Critical будет превышен: если это произойдёт, вступит в силу более жёсткий режим Preparedness Framework вплоть до полной остановки разработки, и часть внутренней работы над Astra уже приостановлена. Z.ai теперь действует по той же логике с GLM-5.3: откладывает публикацию весов примерно на две недели ради дополнительной проверки безопасности и планирует ограничить самые чувствительные киберфункции проверенными пользователями.
Итоговый расклад по оставшемуся лидерству, по мнению редакции THE DECODER: разрыв в абстрактных тестах измерим, но неясно, чего он стоит экономически; разрыв в надёжности важнее всего коммерчески, но наименее устойчив, раз более новая модель (GPT-5.6 Sol) уже отстаёт по этому показателю от собственной предшественницы внутри одной лаборатории, место в рейтинге явно не зафиксировано; разрыв в кибербезопасности касается возможностей, которые почти никто и не может купить через обычные каналы, и даже он в последнее время резко сократился. Всё коммерчески ценное, код, исследования, агентная работа, обязано оставаться доступным через API, иначе бизнеса просто нет. И именно там лидерство исчезает за считаные месяцы.
Очевидное подозрение в том, что оба процесса связаны между собой: китайские лаборатории якобы используют западные модели как учителей через их же API (та самая дистилляция), и тогда лидерство держится ровно там, где такого доступа нет. По данным Anthropic, промышленные кампании, приписываемые сразу DeepSeek, Moonshot и MiniMax, охватили более 16 млн обращений через около 24 000 мошеннических аккаунтов; кампания, которую компания связывает именно с Moonshot, была нацелена на агентные рассуждения, использование инструментов, код и цепочки рассуждений и включала более 3,4 млн обращений. Это согласуется с находкой Together AI: корреляция 0,72 между долей успешно решённых задач у K3 и Fable 5 на реальных программистских задачах, а также со стилистическим анализом Typebulb, по которому K3 по стилю ближе всего именно к Fable 5. Критики возражают: промежуток между выходом Fable 5 и K3 был слишком коротким, чтобы повлиять на обучение K3. Но Opus 4.8, родственная модель, доступная гораздо дольше, по тем же исследованиям показывает не менее явные совпадения. Похожую схему с DeepSeek описывает и OpenAI в собственном меморандуме Конгрессу США. При этом ни одна из лабораторий не опубликовала проверяемых доказательств, а собственные запросы THE DECODER в OpenAI и Anthropic ничего нового не дали.
Тем не менее известные обвинения и ряд исследовательских работ позволяют реконструировать, как дистилляция могла бы работать технически. Обучение модели проходит через претрейнинг (базовые способности из огромного массива текста), мидтрейнинг (меньше данных, но более высокого качества) и посттрейнинг (тонкая настройка с учителем и обучение с подкреплением), данные, полученные от чужой модели, теоретически можно встроить почти на любом из этих этапов. Ведущая западная модель отвечает на десятки тысяч отобранных задач вместе с полными цепочками решения и вызовами инструментов; лучшие ответы попадают в мидтрейнинг или тонкую настройку, и модель-«ученик» перенимает манеру решения у модели-«учителя». Для обучения с подкреплением модель-учитель вообще не обязана оставаться доступной: собранные от неё данные можно использовать для построения отдельной модели вознаграждения. По собственному отчёту Anthropic, это не просто теория: в кампании, приписываемой DeepSeek, модель Claude в промышленных масштабах оценивала чужие ответы по заданным критериям, по сути, выполняя роль модели вознаграждения в чужом обучении с подкреплением.
Ключевые факты
- Китайские модели с открытыми весами, Kimi K3 (Moonshot), GLM-5.3 (Z.ai), Qwen3.8-Max (Alibaba), вышли на уровень лучших западных моделей почти по всем крупным тестам; в индексе Intelligence Index модель Kimi K3 дебютировала на 3-м месте с 57 баллами, всего в 4 баллах от новой вершины (Opus 5, 61 балл).
- Измеримое лидерство Запада сузилось до трёх направлений: абстрактное мышление (тест ARC-AGI-2: 60,4% у K3 против 89,2% у Fable 5), надёжность повторяемых решений (пять из пяти попыток: 39% у K3 против 54% у Opus 5) и наступательная кибербезопасность (тест ExploitBench: 32% у K3 против ~76% у топовых американских моделей).
- Разрыв в кибербезопасности сокращается особенно быстро: GLM-5.3 подняла результат на ExploitBench до 54,4%, более чем вдвое выше показателя предыдущей модели GLM-5.2, и за месяц вдвое сократила отставание от американских лидеров.
- Anthropic и OpenAI обвиняют китайские лаборатории в дистилляции, обучении на выходах западных моделей через их же API; по данным Anthropic, кампании, приписываемые DeepSeek, Moonshot и MiniMax, охватили более 16 млн обращений через около 24 000 мошеннических аккаунтов, но проверяемых доказательств ни одна из сторон не опубликовала.
- Из-за размывания лидерства на уровне моделей компании Anthropic перед IPO приходится отвечать на неудобные вопросы инвесторов (по данным Wall Street Journal); собственный тезис THE DECODER, конкурентное преимущество теперь определяет не сама модель, а система вокруг неё.
Почему это важно
Ещё полтора года назад, после DeepSeek R1, речь шла о точечных прорывах: китайская модель обгоняла западную на паре тестов и заметно проигрывала на других. Материал THE DECODER фиксирует качественный сдвиг: новые китайские модели с открытыми весами (Kimi K3, GLM-5.3, Qwen3.8-Max) вышли к вершине почти всех крупных и требовательных бенчмарков разом, а не по отдельным дисциплинам. Это меняет саму логику конкуренции в индустрии: если модель как таковая перестаёт быть устойчивым преимуществом, то, что эксклюзивно умеет одна лаборатория сегодня, через несколько месяцев доступно бесплатно, компаниям приходится искать защитимое преимущество не в самой модели, а в организации вокруг неё. Именно поэтому, как отмечает издание со ссылкой на Wall Street Journal, перед IPO компании Anthropic уже приходится отвечать на неудобные вопросы инвесторов.
Кому это важно
В первую очередь, тем, кто оценивает или финансирует ИИ-лаборатории: если сама модель больше не гарантирует эксклюзивности, инвестиционный тезис должен строиться на чём-то другом. Во вторую, командам, которые выбирают модели для продуктов и внутренних инструментов: для большинства задач разница между открытыми китайскими и топовыми западными моделями теперь минимальна, а по цене за решённую задачу открытые модели часто выигрывают. В третью, тем, кто следит за регулированием ИИ и наступательной кибербезопасностью: именно в этой области сохраняется самый большой измеримый разрыв, и именно в ней действуют формальные пороги риска вроде Preparedness Framework у OpenAI.
Как это применить
При выборе модели для конкретной задачи не стоит полагаться на общий рейтинг вроде Intelligence Index, «фронтир» неровный, и лидерство меняется от теста к тесту: там, где важна повторяемость результата (агентные конвейеры без ручной проверки), стоит смотреть не на первую попытку, а на метрики вроде pass^5, где место в рейтинге может оказаться иным. Если критична стоимость, важно считать не только цену токена, но и итоговую стоимость решения задачи, китайские модели иногда решают её за счёт большего числа токенов, и ценовое преимущество на бумаге может не подтвердиться на практике. Для интеграций через API стоит учитывать, что самые чувствительные возможности, в первую очередь киберфункции, и западные лаборатории, и теперь Z.ai сознательно придерживают вне публичного доступа.
Можно ли доверять
Это аналитический разбор, а не новость об одном событии: четвёртый выпуск регулярной рубрики THE DECODER «Frontier Radar», которая выходит шесть раз в год и обычно доступна только подписчикам издания; по данным метаданных страницы, автор материала, Максимилиан Шрайнер. Цифры в тексте, смесь независимых оценок (индекс Intelligence Index от Artificial Analysis, совместная проверка кибербезопасности от британского AISI и американского CAISI, корреляционный анализ Together AI) и результатов, которые компании измерили сами: показатели GLM-5.3 и GPT-5.6 Sol на ExploitBench, это собственные замеры Z.ai и OpenAI, а не независимая проверка. Обвинения в дистилляции сам материал называет недоказанными: ни одна из лабораторий не опубликовала проверяемых доказательств, а собственные запросы издания в OpenAI и Anthropic ничего нового не дали, это открытый спор, а не установленный факт.
Риски и подводные камни
Главный риск для читателя, принять предварительные и частично самоизмеренные цифры за окончательный вердикт: показатели по кибербезопасности особенно чувствительны к тому, кто и как их получил (независимая проверка AISI/CAISI против собственных замеров Z.ai и OpenAI). Отдельный риск, сама природа кибербезопасных возможностей: наиболее сильные модели в этой области (Mythos 5 у Anthropic, специализированные версии у OpenAI) намеренно не выпускаются в открытый доступ, а с будущей моделью Astra OpenAI впервые не исключает пересечения порога Critical, что может привести к остановке разработки. Наконец, спор о дистилляции далёк от завершения: если обвинения верны, это ставит под вопрос защитимость любых возможностей, которые лаборатории продают через API, а если нет, значит, китайские лаборатории просто самостоятельно достигли того же уровня, и построенное на модели лидерство в любом случае столь же уязвимо.