Alibaba выпустила Qwen3.8-Flash-Next: экономичная модель обходит Claude Opus 4.6

Команда Qwen (Alibaba) выпустила Qwen3.8-Flash-Next, мультимодальную модель смешанных экспертов (mixture-of-experts), которую компания называет архитектурным предпоказом будущей Qwen4. Цель, приблизиться к результатам куда более крупных моделей при кратно меньшей стоимости обучения; сама Alibaba формулирует задачу как «предельную экономическую эффективность».
У модели 125 млрд параметров всего, но на каждый токен активируется только 6 млрд. Отдельно в архитектуру встроен слой на 51 млрд параметров, новый механизм N-gram-эмбеддингов, одна из наработок, которые пойдут в Qwen4. Он хранит частые словосочетания как отдельные записи, по сути «словарь фраз», и может размещаться в обычной оперативной памяти сервера, а не на GPU, при «относительно небольших» дополнительных затратах. Модель нативно поддерживает контекст в 262 144 токена и может масштабироваться до одного миллиона токенов с помощью техники YaRN. Технический отчёт выложен на GitHub, веса, на Hugging Face и ModelScope. Продакшн-версия называется Qwen3.8-Flash и доступна через QwenCloud по цене $0,16 за миллион входных токенов и $0,47 за миллион выходных; по данным Qwen, API должен заработать в ближайшее время.
По словам команды Qwen, Qwen3.8-Flash-Next показывает результаты лучше, чем предыдущая Qwen3.7-Plus (397 млрд параметров, 17 млрд активных на токен, почти втрое больше, чем у Flash-Next), при этом обучение обошлось примерно в девять раз дешевле; сильнее всего разрыв в задачах на кодинг и офисные сценарии. В опубликованных Alibaba бенчмарках Flash-Next сравнивается с DeepSeek-V4-Flash (284 млрд параметров, 13 млрд активных) и с Claude Opus 4.6 от Anthropic, и, несмотря на то что обе модели-конкурента крупнее или дороже, лидирует в большинстве проверенных задач. На бенчмарках агентного кодинга (модель самостоятельно находит и чинит баги в реальных проектах) Flash-Next набрала 58,7 балла на DeepSWE и 62,5 на SWE-bench Pro, обойдя там и DeepSeek-V4-Flash, и Claude Opus 4.6, точные баллы этих двух конкурентов источник не приводит. На офисных задачах разрыв ещё шире: на CoWorkBench у Flash-Next 73,9 против 45,1 у DeepSeek-V4-Flash (результат Claude Opus 4.6 не указан); на JobBench, тесте на профессиональные рабочие сценарии, у Flash-Next 55,7, почти вдвое больше, чем 27,6 у Qwen3.7-Plus. На научном рассуждении (GPQA Diamond: 91,7) и соревновательном программировании (LiveCodeBench v6: 91,9) модели идут почти вровень; источник не уточняет, какой именно модели принадлежат эти два числа. Claude Opus 4.6 выходит вперёд только на Humanity's Last Exam, тесте на крайне сложные междисциплинарные задачи, но источник называет её при этом «более старой» моделью Anthropic, вышедшей в феврале 2026 года. Издание The Decoder добавляет обычную оговорку: результаты бенчмарков и реальная работа модели могут расходиться.
Контекст по ценам: буквально в начале августа Alibaba представила Qwen3.8-Max как свою текущую флагманскую модель, которую компания сравнивает с Claude Opus 4.8, Gemini 3.1 Pro и GPT5.6 Sol. Qwen3.8-Flash-Next работает чуть хуже флагмана, но стоит примерно в двенадцать раз дешевле, и по входным, и по выходным токенам. По данным The Decoder, в последнее время также популярна Qwen3.8-27B, модель, которую можно запустить локально и получить сильные результаты почти бесплатно, если есть подходящее железо. На это, как пишет издание, OpenAI недавно ответила резкими скидками на новую линейку GPT-5.6: это хорошо для пользователей, но плохо для темпов роста выручки, которые нужны ИИ-провайдерам, чтобы поддерживать инвестиционную историю вокруг себя.
Ключевые факты
- Qwen3.8-Flash-Next, модель смешанных экспертов на 125 млрд параметров, из которых на каждый токен активируется всего 6 млрд; Alibaba называет её архитектурным предпоказом будущей Qwen4.
- Отдельный слой на 51 млрд параметров реализует новый механизм N-gram-эмбеддингов («словарь фраз»), который можно хранить в обычной оперативной памяти вместо GPU.
- По бенчмаркам Alibaba модель обучена примерно в девять раз дешевле, чем Qwen3.7-Plus, и обходит её, а также DeepSeek-V4-Flash и Claude Opus 4.6 в большинстве проверенных задач, Claude лидирует только на Humanity's Last Exam.
- Продакшн-версия Qwen3.8-Flash доступна через QwenCloud по $0,16 за миллион входных и $0,47 за миллион выходных токенов; контекст, 262 144 токена нативно, до 1 млн токенов с YaRN.
- Цена примерно в 12 раз ниже флагманской Qwen3.8-Max при результатах чуть ниже неё, очередной шаг ценового давления Alibaba на OpenAI и Anthropic.
Почему это важно
Qwen3.8-Flash-Next показывает, что Alibaba умеет получать результаты уровня гораздо более крупных и дорогих моделей за счёт архитектуры, а не масштаба: активных параметров на токен почти втрое меньше, чем у предыдущей Qwen3.7-Plus, а обучение обошлось примерно в девять раз дешевле, чем у неё же. Новый слой N-gram-эмбеддингов, который можно держать в обычной оперативной памяти вместо GPU, часть архитектуры, заявленной как предпоказ Qwen4, то есть модель одновременно и коммерческий продукт, и витрина будущих технических решений компании.
Кому это важно
В первую очередь, командам, которые строят агентные инструменты для кодинга и офисных задач: именно там Flash-Next показывает наибольший отрыв от конкурентов. Также это важно компаниям, которые считают стоимость инференса при масштабировании ИИ-сервисов, и разработчикам, запускающим модели локально: младшая Qwen3.8-27B, по данным издания, уже популярна за счёт низкой стоимости запуска при наличии подходящего железа.
Как это применить
Продакшн-версия модели, названная Qwen3.8-Flash, доступна через QwenCloud по $0,16 за миллион входных токенов и $0,47 за миллион выходных; по данным Qwen, API должен заработать в ближайшее время. Модель нативно работает с контекстом в 262 144 токена и может масштабироваться до одного миллиона с помощью YaRN. Технический отчёт опубликован на GitHub, веса, на Hugging Face и ModelScope, что позволяет изучить архитектуру и развернуть модель самостоятельно.
Можно ли доверять
Все цифры о сравнении с DeepSeek-V4-Flash и Claude Opus 4.6, это собственные бенчмарки Alibaba, независимой проверки в источнике нет. По части сравнений (DeepSWE, SWE-bench Pro, CoWorkBench, JobBench) точные баллы конкурентов не раскрыты, известно только, что Flash-Next их обошла. Само издание The Decoder добавляет обычную оговорку о том, что результаты бенчмарков и реальная работа модели на практике могут расходиться.
Риски и подводные камни
Источник не всегда указывает, какой именно модели принадлежат приведённые цифры: например, для GPQA Diamond (91,7) и LiveCodeBench v6 (91,9) не уточняется, о какой из моделей идёт речь. Не раскрыта и величина «относительно небольших» дополнительных затрат на хранение слоя N-gram-эмбеддингов в оперативной памяти. Наконец, агрессивное ценовое давление Qwen на рынок, при котором OpenAI уже отвечает скидками на GPT-5.6, хорошо для пользователей, но, как отмечает издание, бьёт по темпам роста выручки, на которых держится инвестиционная история ИИ-индустрии.