Qwen 3.8 27B набрала 52 балла в бенчмарке, вровень с моделями крупнее в разы

Qwen 3.8 27B набрала 52 балла в Artificial Analysis Intelligence Index, независимом бенчмарке, оценивающем общий уровень способностей языковых моделей. Это ровно тот же результат, что показала GPT-5.6 Luna (max), и всего на один балл меньше, чем у GLM-5.2 (max) и DeepSeek V4 Pro 0813 (max).

Разница в размере моделей при этом огромная. У Qwen 3.8 27B, 27 миллиардов параметров. GLM-5.2 (max), по данным источника, 753 миллиарда параметров, то есть почти в 28 раз больше. DeepSeek V4 Pro 0813 (max) источник называет моделью на 1,6 миллиарда параметров, то есть, если верить этой цифре, даже меньше самой Qwen 3.8 27B, при этом опережающей её на один балл; точный размер GPT-5.6 Luna (max) не раскрыт, но автор поста предполагает, что она значительно крупнее Qwen 3.8 27B.

Пост, короткая заметка в личном блоге Саймона Уиллисона со ссылкой на результаты индекса; сам автор называет результат Qwen 3.8 27B «по-настоящему поразительным». Источник не называет разработчиков ни одной из перечисленных моделей, не объясняет методику подсчёта баллов индекса и не указывает дату, когда именно были получены сами оценки, только дату публикации заметки, 17 августа 2026 года.

Ключевые факты

  • Qwen 3.8 27B набрала 52 балла в Artificial Analysis Intelligence Index, ровно столько же, сколько GPT-5.6 Luna (max).
  • GLM-5.2 (max) и DeepSeek V4 Pro 0813 (max) опережают Qwen 3.8 27B всего на один балл.
  • У Qwen 3.8 27B, 27 миллиардов параметров; у GLM-5.2 (max), по источнику, 753 миллиарда, почти в 28 раз больше.
  • DeepSeek V4 Pro 0813 (max) источник называет моделью на 1,6 миллиарда параметров; размер GPT-5.6 Luna (max) не раскрыт.
  • Источник, короткая заметка в блоге Саймона Уиллисона; методика подсчёта баллов индекса и разработчики моделей в тексте не названы.

Почему это важно

Artificial Analysis Intelligence Index сравнивает модели по общему уровню способностей. Здесь модель на 27 миллиардов параметров показывает результат, почти неотличимый от результатов моделей, названных в источнике в разы (а по одной из приведённых там цифр, на порядок) крупнее. Это иллюстрирует общий тренд: рост балла по такому бенчмарку всё меньше жёстко привязан к числу параметров модели.

Кому это важно

Разработчикам приложений на базе языковых моделей, исследователям и инженерам, которые сравнивают модели по бенчмаркам способностей перед тем, как выбрать одну из них для задачи.

Как это применить

Источник не даёт ни цены, ни лицензии, ни данных о доступности Qwen 3.8 27B, только сравнение баллов по одному индексу. Практический вывод из самих цифр: при выборе модели полагаться на одно число параметров становится всё менее надёжно, стоит смотреть на результаты независимых бенчмарков.

Можно ли доверять

Материал, короткая заметка со ссылкой в личном блоге Саймона Уиллисона, а не отчёт самого Artificial Analysis Index с разбором методики. Источник не называет ни разработчиков перечисленных моделей, ни дату самого замера, ни принцип подсчёта балла. Приведённая в источнике цифра параметров DeepSeek V4 Pro 0813 (max), 1,6 миллиарда, выглядит подозрительно скромной на фоне того, что эта модель опережает по баллу гораздо более крупную по параметрам Qwen 3.8 27B; проверить это по самому источнику нельзя, ссылки на детали методики в тексте нет.

Риски и подводные камни

Без описания методики индекса и без даты замера сравнение баллов может не учитывать различия между тестовыми прогонами моделей или устареть. Цифра параметров DeepSeek V4 Pro 0813 (max), приведённая в источнике, может быть опечаткой или ошибкой, на неё стоит опираться с осторожностью, отдельно перепроверив по первоисточнику Artificial Analysis.

«Qwen 3.8 27B, по-настоящему поразительная модель.»

— Саймон Уиллисон