Kimi K3 обошла Claude Fable 5 и GPT-5.6 Sol по фронтенд-коду, но провалила сложную математику

Китайская компания Moonshot представила модель Kimi K3, и два новых замера показывают противоречивую картину её силы относительно западных лидеров.
В бенчмарке Code Arena: Frontend, который ранжирует модели по предпочтениям живых людей при оценке сгенерированного фронтенд-кода, Kimi K3 набрала 1679 очков. Это выше, чем у Claude Fable 5 (1631 очко) и GPT-5.6 Sol (1618 очков), а также выше всех остальных протестированных моделей, с заметным отрывом. Это первый случай, когда китайская модель занимает первое место в этом рейтинге.
Со сложной математикой ситуация обратная. По данным независимой исследовательской организации Epoch AI, на бенчмарке FrontierMath Tier 4, самом сложном уровне экспертных математических задач, Kimi K3 показывает точность около 39%. Для сравнения, модели OpenAI и Anthropic на этом же бенчмарке в отдельных случаях приближаются к 90% точности.
Таким образом, Kimi K3 демонстрирует, что китайские модели способны обгонять западных лидеров в узких прикладных задачах вроде генерации фронтенд-интерфейсов, но разрыв в глубоком математическом рассуждении на экспертном уровне остаётся значительным.
Ключевые факты
- Kimi K3 от Moonshot набрала 1679 очков в Code Arena: Frontend, обойдя Claude Fable 5 (1631) и GPT-5.6 Sol (1618), лучший результат среди всех протестированных моделей
- Это первый случай, когда китайская модель занимает первое место в этом бенчмарке фронтенд-кода
- На FrontierMath Tier 4 (самый сложный уровень экспертных математических задач) точность Kimi K3, около 39%
- Модели OpenAI и Anthropic на FrontierMath Tier 4 в отдельных случаях показывают точность, близкую к 90%
- Данные по математическому бенчмарку предоставлены независимой исследовательской организацией Epoch AI
Почему это важно
Kimi K3, первая китайская модель, занявшая первое место в бенчмарке Code Arena: Frontend, который оценивает качество генерации фронтенд-кода по предпочтениям живых людей. Это символический сдвиг: ещё недавно верхние строчки подобных рейтингов занимали исключительно модели OpenAI и Anthropic. При этом та же модель заметно отстаёт от западных лидеров в сложных математических задачах, разрыв в глубоком рассуждении на экспертном уровне не закрыт.
Кому это важно
Разработчикам, которые выбирают модель для генерации UI и фронтенд-кода, им стоит присмотреться к Kimi K3 как к альтернативе. Исследователям и компаниям, следящим за гонкой моделей США и Китая, результат показывает, в каких именно классах задач разрыв сокращается, а в каких нет. Командам, строящим продукты на базе LLM для математических и научных вычислений, им пока безопаснее ориентироваться на модели OpenAI и Anthropic.
Как это применить
Для задач генерации фронтенд-интерфейсов и UI-кода Kimi K3 по данному бенчмарку можно рассматривать как один из сильнейших доступных вариантов, включая китайскую модель как более дешёвую альтернативу западным. Для задач, требующих сложного математического или логического рассуждения экспертного уровня, стоит по-прежнему полагаться на модели OpenAI или Anthropic, Kimi K3 там заметно слабее.
Можно ли доверять
Оба замера, из разных источников с разной методологией. Code Arena: Frontend строится на предпочтениях живых людей, что вносит элемент субъективности, но отражает реальное восприятие качества кода пользователями. Данные FrontierMath Tier 4 получены от Epoch AI, независимой исследовательской организации, специализирующейся на оценке возможностей ИИ-моделей, что повышает доверие к цифре по математике.
Риски и подводные камни
Лидерство в одном узком бенчмарке фронтенд-кода не означает превосходства модели в целом, Kimi K3 может уступать в других задачах программирования (бэкенд, системный код, отладка), которые статья не затрагивает. Рейтинги на основе предпочтений людей могут отражать стиль и оформление кода, а не только его корректность. Разрыв в математике более чем в 2,3 раза (39% против почти 90%) показывает, что сильные результаты в одной области не гарантируют силу в других, сравнение моделей требует смотреть на несколько бенчмарков сразу, а не на один.