Qwen выпустила Qwen3.8-Flash-Next, превью архитектуры Qwen4
Qwen выпустила новую открытую модель, Qwen3.8-Flash-Next. По формулировке источника, это мультимодальная модель с архитектурой MoE (mixture-of-experts, «смесь экспертов»), которая одновременно служит ранним превью архитектуры, ложащейся в основу будущей Qwen4.
У модели, по данным поста, 125 млрд «токенов» (именно так эта величина названа в источнике), но одновременно активны из них только 6 млрд. По словам автора заметки, именно такая разреженность и даёт модели значительный прирост производительности.
Автор поста, технический блогер Саймон Уиллисон, опробовал модель на компьютере DGX Spark, используя квантованные сборки от команды Unsloth: 72,5-гигабайтную версию UD-IQ1_S и 78,9-гигабайтную UD-Q2_K_XL. По его словам, он всё ещё продолжает изучать модель; из опробованного лучший результат дал режим «xhigh reasoning effort» на сборке UD-Q2_K_XL. В качестве иллюстраций автор приводит сгенерированные моделью изображения, обозначенные в тексте просто как «эти пеликаны» и «эти», отдельного описания самих изображений в посте нет.
Пост не приводит ни бенчмарков, ни сравнения с другими моделями, ни условий лицензии, ни точной даты релиза самой модели, указана только дата публикации заметки, 26 августа 2026 года. Не назван и автор процитированного описания модели («мультимодальная MoE-модель, служащая ранним превью архитектуры Qwen4»), в оригинальном заголовке поста стоит пометка «(via)», которая намекает на источник у самой Qwen, но прямо в тексте это не указано.
Ключевые факты
- Qwen выпустила Qwen3.8-Flash-Next, открытую мультимодальную MoE-модель, названную в источнике ранним превью архитектуры будущей Qwen4.
- У модели 125 млрд («токенов», как указано в источнике), но активны из них лишь 6 млрд, такая разреженность и даёт, по словам автора, значительный прирост производительности.
- Технический блогер Саймон Уиллисон протестировал квантованные Unsloth-сборки модели на компьютере DGX Spark: 72,5 ГБ (UD-IQ1_S) и 78,9 ГБ (UD-Q2_K_XL).
- Лучший результат из опробованного, по его словам, дал режим «xhigh reasoning effort» на сборке UD-Q2_K_XL.
- В посте нет ни бенчмарков, ни сравнения с другими моделями, ни условий лицензии, ни точной даты релиза модели, указана только дата публикации заметки, 26 августа 2026 года.
Почему это важно
Qwen3.8-Flash-Next, открытая мультимодальная модель с архитектурой MoE, которая, по формулировке источника, служит ранним превью архитектуры будущей Qwen4. Уже сейчас можно увидеть, в какую сторону движется следующее поколение линейки Qwen, одной из крупных открытых альтернатив закрытым моделям. Отдельный интерес, соотношение общего и активного размера: 125 млрд («токенов», как указано в источнике) при 6 млрд активных. Такая разреженность, общий тренд среди современных MoE-моделей: она даёт качество, сопоставимое с гораздо более крупной «плотной» моделью, но заметно дешевле по вычислениям при выводе.
Кому это важно
Разработчикам и исследователям, которые работают с открытыми весами и запускают модели локально, у них появляется ещё один MoE-вариант для экспериментов и ещё одна точка данных о направлении развития архитектуры Qwen. Тем, кто уже использует модели линейки Qwen, Qwen3.8-Flash-Next напрямую показывает, какие архитектурные изменения могут прийти в преемников. Энтузиастам локального инференса на компактном железе вроде DGX Spark, именно на нём тестировал модель автор поста.
Как это применить
Модель распространяется в открытых весах, а квантованные сборки под неё уже выпустила команда Unsloth, в посте упомянуты варианты UD-IQ1_S (72,5 ГБ) и UD-Q2_K_XL (78,9 ГБ), которые можно запускать локально на подходящем железе (автор пробовал их на компьютере DGX Spark). При инференсе можно управлять уровнем «усилия» модели при рассуждении; в посте отдельно отмечен режим «xhigh reasoning effort» на сборке UD-Q2_K_XL как давший лучший результат из опробованного автором.
Можно ли доверять
Источник, личная заметка технического блогера Саймона Уиллисона в формате блога со ссылками: он сам тестировал квантованные сборки модели, а не пересказывал чужой анонс, что добавляет достоверности практической части (модель действительно запускается и выдаёт результат). Но формальных доказательств в посте нет: ни одного бенчмарка, ни сравнения с другими моделями, ни условий лицензии не приведено, тезис о «значительном приросте производительности» опирается на общее рассуждение об архитектуре MoE, а не на измеренные цифры. Не назван и автор исходной формулировки о том, что модель, превью архитектуры Qwen4: в оригинальном заголовке поста стоит пометка «(via)», которая намекает на источник у самой Qwen, но прямо это в тексте не сказано.
Риски и подводные камни
Модель прямо названа «ранним превью» архитектуры Qwen4, а не финальным продуктом, не исключены нестабильность, недоработки и то, что итоговая Qwen4 будет заметно отличаться от этого промежуточного варианта. Даже сильно сжатые квантованные сборки весят 72,5, 78,9 ГБ, то есть для локального запуска нужно железо с солидным объёмом памяти. Ни лицензия, ни официальная дата релиза самой модели в посте не указаны, названа только дата публикации заметки, 26 августа 2026 года, так что эти детали стоит уточнить отдельно перед практическим использованием.