Qwen выпустила Qwen3.8, первую открытую модель уровня Max

Qwen выпустила Qwen3.8, первую открытую модель уровня Max

Команда Qwen опубликовала на Hugging Face веса модели Qwen3.8-2.4T-A95B, открытую версию новой линейки Qwen3.8. По словам разработчиков, это первая модель уровня Qwen-Max, которую они выложили в открытый доступ: раньше модели этого класса были доступны только через закрытый облачный сервис. Qwen3.8 построена на архитектурной основе Qwen3.5 и нацелена на заметный прирост в кодинге, профессиональных задачах, исследованиях и долгих агентных сценариях, модель должна не просто отвечать на более сложные вопросы, а доводить многошаговые задачи до конца.

У выложенного чекпоинта 2,4 трлн параметров в сумме, из них на каждый токен активируются 95 млрд. Модель имеет 92 слоя, скрытую размерность 8192 и таблицу эмбеддингов на 248 320 токенов (с паддингом). Слой Mixture-of-Experts включает 512 экспертов, из которых на каждый токен активируются 10 маршрутизируемых плюс 1 общий, с промежуточной размерностью эксперта 2048. Архитектура сочетает блоки Gated DeltaNet (128 голов внимания для V и 16 для QK) с блоками Gated Attention (64 головы для Q, 4 для KV, размерность головы 256 и позиционные эмбеддинги на 64 измерения), повторяющиеся 23 раза: каждая группа, три блока DeltaNet-в-MoE плюс один блок Gated-Attention-в-MoE. Также используется multi-token prediction (предсказание нескольких токенов за шаг), обученное в несколько этапов. Нативная длина контекста, 262 144 токена, с расширением до 1 010 000 токенов.

Qwen3.8-2.4T-A95B работает только с текстом: мультимодальный ввод не поддерживается, а режим рассуждений отключить нельзя, каждый ответ начинается с блока рассуждений перед финальным текстом. Глубину рассуждений можно регулировать параметром reasoning_effort с тремя уровнями: xhigh (по умолчанию, для тщательного анализа), medium (баланс точности и скорости) и low (упор на скорость и стоимость); preserve_thinking, сохраняющий контекст рассуждений между репликами диалога, включён по умолчанию. Для генерации карточка модели рекомендует temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0 и repetition_penalty=1.0. Веса совместимы с Transformers, vLLM, SGLang и TokenSpeed, модель можно развернуть напрямую через Docker Model Runner или запустить через HuggingChat, Colab и Kaggle.

Для тех, кто не хочет разворачивать модель самостоятельно, Qwen предлагает облачный аналог, Qwen3.8-Max, через API Qwen Cloud. Qwen3.8-Max описана как та же базовая модель с дополнительными возможностями: приём изображений, поддержка отключения режима рассуждений, контекст в 1 млн токенов по умолчанию и встроенные инструменты. Цена Qwen3.8-Max и API-сервиса в материале не указана.

Карточка модели приводит результаты по большому набору бенчмарков для кода и агентных задач: Terminal Bench 2.1, SWE-bench Pro, DeepSWE 1.1, NL2Repo-Bench, FrontierSWE, MLS-Bench-Lite, PaperBench, AndroidBench и несколько внутренних бенчмарков Qwen (QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench, CoWorkBench, SkillsBench, Automation-Bench, WideSearch), большинство прогонов сделаны через инструментарий Claude Code. Заявленные модели для сравнения, Claude Opus 4.8, Claude Fable 5 (через Terminus 2) и GPT-5.6 Sol (через Codex). В доступном материале описана методика оценки и сноски к каждому бенчмарку, но самой таблицы с итоговыми баллами в тексте нет, поэтому сказать, как именно Qwen3.8-2.4T-A95B показала себя в этих сравнениях, здесь нельзя.

Ключевые факты

  • Qwen3.8-2.4T-A95B, 2,4 трлн параметров в сумме, 95 млрд активны на каждый токен; архитектура на основе Qwen3.5.
  • Это первая модель уровня Qwen-Max, выложенная с открытыми весами, раньше такие модели были только в закрытом облачном сервисе.
  • Нативный контекст, 262 144 токена, расширяемый до 1 010 000 токенов; модель только текстовая, режим рассуждений отключить нельзя.
  • Глубину рассуждений регулирует параметр reasoning_effort (xhigh/medium/low), а preserve_thinking по умолчанию сохраняет контекст рассуждений между репликами.
  • Облачная версия Qwen3.8-Max добавляет приём изображений, отключаемые рассуждения, контекст в 1 млн токенов по умолчанию и встроенные инструменты, через API Qwen Cloud.

Почему это важно

Qwen-Max раньше был закрытым, доступным только через API уровнем линейки Qwen. Qwen3.8-2.4T-A95B, по словам самих разработчиков, первая модель этого класса, чьи веса выложены в открытый доступ, а не спрятаны за API. Модель получила 2,4 трлн параметров (95 млрд активных), архитектуру на основе Qwen3.5 и нацелена именно на кодинг, профессиональные и исследовательские задачи, а также на долгие агентные сценарии, задачи, где важно довести многошаговый процесс до конца, а не просто один раз правильно ответить.

Кому это важно

Аудитория, разработчики и команды, которым нужны открытые веса топ-уровня для самостоятельного хостинга, дообучения или анализа, а не рядовые пользователи чат-ботов. Развернуть модель с 2,4 трлн параметров (95 млрд активных) требует серьёзной инфраструктуры, а карточка модели постоянно ссылается на агентные инструменты вроде Claude Code, SGLang и vLLM, значит, в первую очередь модель рассчитана на тех, кто строит кодинг-агентов и автоматизацию. Тем, кому нужен более лёгкий управляемый вариант, разработчики предлагают облачную Qwen3.8-Max.

Как это применить

Веса можно загрузить напрямую через Hugging Face Transformers либо развернуть через vLLM, SGLang, TokenSpeed или Docker Model Runner, для каждого варианта в карточке есть готовый код. Глубину рассуждений задаёт параметр reasoning_effort (по умолчанию xhigh, можно снизить до medium или low), а preserve_thinking (тоже включён по умолчанию) сохраняет прежние рассуждения в контексте диалога. Рекомендованные параметры генерации: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0. На этом чекпоинте режим рассуждений отключить нельзя; для отключаемых рассуждений, приёма изображений, контекста в 1 млн токенов по умолчанию и встроенных инструментов разработчики отправляют к облачной Qwen3.8-Max через API Qwen Cloud, цена которого не указана.

Можно ли доверять

Все заявления взяты из собственной карточки модели Qwen, это первичный источник, а не независимый обзор. В ней описаны прогоны по большому списку бенчмарков для кода и агентных задач, Terminal Bench 2.1, SWE-bench Pro, DeepSWE 1.1, NL2Repo-Bench, FrontierSWE и ряду внутренних бенчмарков Qwen, в основном через инструментарий Claude Code, с Claude Opus 4.8, Claude Fable 5 и GPT-5.6 Sol в качестве моделей сравнения. В доступном тексте есть методика и сноски к каждому бенчмарку, но самой таблицы с итоговыми баллами нет, поэтому, как Qwen3.8-2.4T-A95B реально показала себя на фоне конкурентов, по этому материалу сказать нельзя.

Риски и подводные камни

Режим рассуждений на этом чекпоинте обязателен и не отключается, каждый ответ несёт вступление с рассуждениями, что добавляет задержку и стоимость токенов даже для простых запросов. Открытая версия, только текстовая, приём изображений оставлен облачной Qwen3.8-Max. В карточке нет ни даты релиза, ни имён авторов или команды (текст говорит только от лица «мы»/Qwen), ни цены облачного API. Самостоятельный хостинг модели с 2,4 трлн параметров, даже с 95 млрд активных, тяжёлое требование к железу, которое большинство команд не потянет напрямую.

«Qwen3.8-2.4T-A95B, текстовая модель, которая всегда работает в режиме рассуждений.»

— карточка модели (Qwen)