Qwen3.8-Flash-Next: сопоставимая точность с более крупным предшественником при вдевятеро меньших затратах на обучение

В статье на Hugging Face описана архитектура Qwen3.8-Flash-Next, разреженной модели смешения экспертов (MoE) с 125 млрд параметров, из которых на каждый токен активируется 6 млрд. Отдельно, вне ускорителя, хранится ещё 51 млрд параметров в таблицах n-грамных эмбеддингов. Модель сравнивают с более крупным предшественником размером 397B-A17B (397 млрд параметров всего, 17 млрд активируются на токен): на 14 бенчмарках для предобучения новая модель обходит предшественника на восьми и отстаёт на оставшихся не более чем на 2,6 балла, при этом используя лишь треть активируемых параметров, треть обучающих токенов и примерно девятую часть вычислений (FLOPs) на обучение.
Смешение токенов построено как послойный гибрид Gated DeltaNet (GDN) и полного внимания: один слой полного внимания приходится на каждые четыре слоя. На этапе продолженного предобучения эти слои полного внимания заменяются на Qwen Sparse Attention (QSA), механизм, который оценивает контекст с гранулярностью микроблоков через компактный «лёгкий» индексатор. Остаточный поток (residual stream) расширен до четырёх ветвей, которые считываются через поэлементный гейт, авторы называют этот приём Gated Residual (GR). Дополнительная ёмкость модели добавлена вне основного бэкбона отдельным слоем n-грамных эмбеддингов, чьи таблицы подгружаются («префетчатся») из памяти хоста.
Каждое архитектурное изменение проверялось по трём осям: влияние на loss и результаты бенчмарков, стоимость в обучении, prefill и decode, и влияние на оптимальные гиперпараметры и стабильность обучения. Авторы отмечают, что loss и точность на бенчмарках не всегда движутся синхронно: увеличение словаря n-грамм монотонно снижает loss, но точность на бенчмарках при этом выходит на плато. Архитектура в сочетании с оптимизатором Muon сдвигает оптимальные значения learning rate и размера батча вверх, делает разогрев (warmup) размера батча ненужным и заметно повышает устойчивость обучения при стресс-тестах.
Ключевые факты
- Qwen3.8-Flash-Next: 125 млрд параметров всего, 6 млрд активируются на токен, плюс отдельные 51 млрд параметров в таблицах n-грамных эмбеддингов вне ускорителя.
- На 14 бенчмарках для предобучения модель обходит более крупного предшественника 397B-A17B на восьми и отстаёт максимум на 2,6 балла на остальных, при трети активируемых параметров, трети обучающих токенов и примерно девятой части вычислений (FLOPs) на обучение.
- Токен-миксинг, гибрид Gated DeltaNet и полного внимания (один слой полного внимания на каждые четыре); на этапе продолженного предобучения полное внимание заменяется на Qwen Sparse Attention (QSA) с оценкой контекста по микроблокам.
- Новый приём Gated Residual расширяет остаточный поток до четырёх ветвей с поэлементным гейтом; отдельный слой n-грамных эмбеддингов добавляет ёмкость вне основного бэкбона и подгружается из памяти хоста.
- Loss и точность на бенчмарках расходятся: рост словаря n-грамм снижает loss, но точность выходит на плато; архитектура вместе с оптимизатором Muon позволяет поднять learning rate и размер батча, убирает необходимость в warmup и повышает стабильность обучения.
Почему это важно
Обучение и инференс больших языковых моделей стоят дорого, и любой способ получить сопоставимое качество меньшими вычислительными затратами напрямую снижает стоимость разработки и обслуживания моделей. Qwen3.8-Flash-Next показывает, что за счёт архитектурных изменений, гибридного внимания, разреженного механизма QSA, приёма Gated Residual и вынесенных n-грамных эмбеддингов, можно почти сравняться по качеству с моделью с существенно большим числом активируемых параметров, потратив на обучение примерно в девять раз меньше вычислений.
Кому это важно
Инженерам и исследователям, которые проектируют и обучают большие разреженные MoE-модели; командам, отвечающим за инфраструктуру инференса (prefill/decode), где экономия на активируемых параметрах и внимании напрямую снижает расходы; тем, кто следит за развитием линейки моделей Qwen и за трендами в эффективных архитектурах внимания (Gated DeltaNet, разреженное внимание).
Как это применить
Работа описывает конкретные архитектурные решения, которые можно переносить в другие модели: соотношение один к четырём между слоями полного и линейного (GDN) внимания на этапе предобучения; замену полного внимания на разреженное QSA с индексатором на этапе продолженного предобучения; расширение остаточного потока до четырёх ветвей с поэлементным гейтом (Gated Residual); вынос части параметров в n-грамные эмбеддинги с префетчем из памяти хоста, что добавляет ёмкость без нагрузки на ускоритель; и сочетание архитектуры с оптимизатором Muon для более высоких learning rate и размера батча без разогрева.
Можно ли доверять
Это отчёт разработчиков модели о собственных архитектурных экспериментах и абляциях, опубликованный на Hugging Face, без независимой проверки третьей стороной. В тексте приведены только относительные результаты (обходит на стольких-то бенчмарках, отстаёт на столько-то баллов), абсолютные цифры loss и точности не раскрываются, конкретные названия всех 14 бенчмарков не перечислены. Институциональная принадлежность авторов и дата релиза модели в тексте не указаны.
Риски и подводные камни
Поскольку раскрыты только относительные показатели, независимо оценить абсолютный уровень качества модели сложно. Сами авторы фиксируют, что снижение loss не гарантирует роста точности на бенчмарках (при росте словаря n-грамм loss падает, а точность выходит на плато), это ограничивает loss как единственный критерий прогресса. Данных о доступности модели (веса, код, чекпоинты) и о реальных вычислительных затратах (GPU-часы, время обучения) в источнике нет, поэтому оценить практическую воспроизводимость и итоговую эффективность результата со стороны пока нельзя.