Qwen выпустила Qwen3.8-27B: компактная модель с изображениями и видео

Команда Qwen выпустила на Hugging Face веса Qwen3.8-27B-FP8, FP8-квантованную версию постобученной модели Qwen3.8-27B. По утверждению разработчиков, точность квантованной версии почти не отличается от оригинала: использован метод пофрагментного (fine-grained) FP8-квантования с размером блока 128.
Qwen3.8-27B, плотная (dense, не MoE) причинная языковая модель с визуальным энкодером на 27 млрд параметров: 64 слоя, скрытая размерность 5120, комбинированная схема внимания (Gated DeltaNet и Gated Attention). Контекст, 262 144 токена нативно, с расширением до 1 000 000 токенов. Модель построена на архитектурной основе Qwen3.5 и, по словам Qwen, следует за широким принятием сообществом линеек Qwen3.5 и Qwen3.6, становясь частью самого способного поколения в открытой линейке Qwen на сегодня.
Ключевая особенность релиза, нативная поддержка изображений и видео: модель без дополнительных надстроек читает STEM-диаграммы, документы и часовые видеозаписи наравне с текстом. Заявлены улучшения в кодинге, профессиональных задачах, исследовательской работе и длинных агентных сценариях, а также более надёжное автономное планирование и обработка обратной связи от окружения.
Режим рассуждений включён по умолчанию и настраивается параметром reasoning_effort с тремя уровнями, xhigh (по умолчанию, для сложных задач), medium (баланс точности и скорости) и low (максимум скорости и экономии). Отдельный параметр preserve_thinking, включённый по умолчанию, сохраняет ход рассуждений между репликами диалога. Qwen отдельно отмечает: в многошаговых агентных сценариях снижение reasoning_effort не всегда ускоряет выполнение задачи целиком, более быстрые ответы на каждом шаге могут привести к недостаточному анализу, ошибкам и повторным попыткам, что в итоге увеличивает общую задержку и расход токенов.
Модель совместима с Hugging Face Transformers, vLLM, SGLang и другими популярными инструментами инференса, поддерживает OpenAI-совместимый Chat Completions API и запуск через Docker. Отдельно Qwen анонсировала облачную версию, Qwen Cloud, где Qwen3.8-27B будет доступна как управляемый хостинг с контекстом 1 млн токенов по умолчанию и встроенными инструментами; сервис пока не запущен («скоро»), цена не названа.
В карточке модели приведён список бенчмарков (SWE-bench Pro, NL2Repo-Bench, DeepSWE 1.1, QwenSWEBench, CoWorkBench, HLE, MathVision и другие) с описанием методологии оценки, но конкретные числовые результаты и сравнение с другими моделями (GPT, Claude, Gemini) в доступном тексте не приведены, только названия тестов и пояснения, как именно они замерялись.
Ключевые факты
- Qwen выпустила FP8-квантованные веса Qwen3.8-27B, плотной модели на 27 млрд параметров с нативной поддержкой изображений и видео
- Контекст, 262 144 токена нативно, расширяется до 1 000 000 токенов; модель построена на архитектуре Qwen3.5
- Глубина рассуждений настраивается тремя уровнями reasoning_effort (xhigh/medium/low), контекст рассуждений сохраняется между репликами через preserve_thinking
- Модель совместима с Transformers, vLLM, SGLang и Docker; отдельно анонсирован управляемый облачный сервис Qwen Cloud с контекстом 1 млн токенов по умолчанию, пока не запущен
- Конкретных числовых результатов бенчмарков и сравнения с конкурентами (GPT, Claude, Gemini) в доступном тексте карточки модели нет, только перечень тестов и методология
Почему это важно
Qwen3.8-27B, новый шаг в открытой линейке моделей Qwen: по словам разработчиков, это самая способная генерация в семействе на сегодня, построенная на архитектуре Qwen3.5 и продолжающая линейки Qwen3.5 и Qwen3.6. Отличие релиза, компактная (27 млрд параметров) плотная модель с нативным пониманием изображений и видео, а не только текста, при этом сохраняющий длинный контекст до 1 млн токенов и гибкое управление глубиной рассуждений.
Кому это важно
Разработчикам и исследователям, которые хотят развернуть у себя относительно компактную, но мультимодальную модель для агентных и кодинговых задач без зависимости от закрытых API; компаниям, которым нужен локальный контроль над инференсом и длинный контекст; тем, кто уже использует линейку Qwen и ждёт следующего поколения.
Как это применить
Веса доступны на Hugging Face в FP8-формате и совместимы с Transformers, vLLM, SGLang, Docker Model Runner, можно развернуть локально с готовым OpenAI-совместимым API. Для управляемого инференса без своей инфраструктуры Qwen анонсировала облачный сервис Qwen Cloud с контекстом 1 млн токенов по умолчанию и встроенными инструментами, но он пока не запущен, цена не объявлена. Глубину рассуждений можно регулировать параметром reasoning_effort под баланс скорости и качества.
Можно ли доверять
Все заявления о качестве и приросте возможностей, из карточки модели, написанной самой Qwen от первого лица; независимого подтверждения нет. В доступном тексте карточки перечислены названия бенчмарков и методология оценки, но сама таблица с числовыми результатами и сравнением с конкурирующими моделями не приведена, так что заявленное превосходство пока нельзя проверить по конкретным цифрам. Утверждение о том, что FP8-квантование почти не теряет в точности относительно оригинальной модели, тоже исходит только от разработчика.
Риски и подводные камни
Лицензия на веса в доступном тексте не указана, дата релиза тоже не названа. Развёртывание 27-миллиардной модели с видео- и текстовым инференсом требует серьёзного GPU-ресурса. Облачный сервис Qwen Cloud с расширенным контекстом заявлен, но не запущен, сроки и цена неизвестны. Разработчики прямо предупреждают: снижение глубины рассуждений (reasoning_effort) ради скорости в многошаговых агентных задачах может, наоборот, увеличить число ошибок, повторных попыток и итоговую задержку.