Qwen 3.8 27B: отличная модель, но с чрезмерным рассуждением по умолчанию

Qwen 3.8 27B: отличная модель, но с чрезмерным рассуждением по умолчанию

В пятницу вышла Qwen 3.8 27B, модель с открытыми весами (лицензия Apache 2.0) на 27 млрд параметров с поддержкой изображений, выпущенная исследовательской лабораторией Qwen при Alibaba. Автор блога тестировал её на двух машинах, 128-гигабайтном MacBook Pro на чипе M5 Max и NVIDIA DGX Spark, через LM Studio, используя квантованную сборку Q4_K_M весом 17 ГБ на диске, а также напрямую через llama-server на Spark. По собственным (пока не подтверждённым независимо) бенчмаркам Qwen, новая модель превосходит и предыдущую Qwen 3.6 27B, и закрытую Qwen 3.7-Plus, которая ещё в мае 2026 года считалась одной из сильнейших моделей линейки.

Главная проблема, уровень рассуждений по умолчанию. По документации Qwen, модель поддерживает три режима: xhigh (по умолчанию), для сложных задач, требующих тщательного анализа; medium, баланс точности и скорости; low, быстрое и дешёвое рассуждение. Сборка для LM Studio сохраняет xhigh по умолчанию, и это, по словам автора, «нелепая» настройка. Простой запрос нарисовать SVG с пеликаном на велосипеде при xhigh занял 21 минуту, модель потратила 22 276 токенов на рассуждения, чтобы выдать 3223 токена результата. Тот же запрос с отключёнными рассуждениями занял 137 секунд (чуть больше двух минут) и дал 3715 токенов. Отдельно автор прогнал тот же промпт через OpenRouter на гораздо большей модели Qwen 3.8 2.4T-A95B (вышла неделей ранее) и получил анимированную SVG-версию. Ещё показательнее, тест с запросом «нарисуй SVG-круг»: при xhigh модель вместо простого круга несколько минут строила концентрические кольца, анимацию и палитру, то есть сделала совсем не то, что просили. Вывод автора: настройку по умолчанию стоит игнорировать и запускать модель на low или вовсе без рассуждений.

При этом визуальные возможности модели впечатлили: на тесте с определением рамок вокруг объектов на фотографии (bounding box, в шкале 0, 1000 по каждой оси) модель точно нашла двух пеликанов на снимке. Автор дал ей же самой написать инструмент для визуализации таких рамок, HTML-страницу с полем для URL картинки и области для вставки JSON с координатами. Из-за забытой настройки reasoning инструмент получился переусложнённым: помимо запрошенного, модель добавила демо-сцену с собственноручно нарисованными силуэтами пеликанов (по мнению автора, из-за того, что слово «pelicans» встретилось в примере промпта). Без включённых рассуждений та же модель написала похожий инструмент с первого раза, но с ошибкой, рамки отображались не в тех местах.

Модель также проверили как движок для кодинг-агента: автор настроил агент Pi (выбран за короткий системный промпт, что удобно для небольших моделей) на работу через LM Studio на Spark, раздаваемую по Tailscale. На вопрос «как устроена авторизация» в проекте Datasette агент через цепочку рассуждений и вызовов инструментов дал развёрнутый и корректный ответ. Модель также написала и протестировала Python-скрипт для конвертации JSONL-транскрипта сессии в markdown.

Основная слабость, скорость: LM Studio выдаёт 15, 30 токенов в секунду, что автор называет недостаточным, чтобы конкурировать с облачными API. Для сравнения, по данным Artificial Analysis, облачная модель OpenAI 5.6 Sol выдаёт 74 токена в секунду, а 5.6 Luna, 184 токена в секунду. Сообщество уже ищет способы ускорения: в модель встроена техника Multi-Token Prediction (MTP), при которой дешёвый механизм заранее угадывает несколько токенов вперёд, а основная модель лишь проверяет догадки, это может заметно ускорить вывод. Опираясь на пост создателя llama.cpp Георгия Герганова, автор запустил модель через llama-server с флагами --spec-type draft-mtp и --reasoning-preserve; сравнительный бенчмарк на Spark (который для автора прогнал GPT-5.6 в Codex) показал прирост скорости около 72% относительно стандартной сборки LM Studio.

Итог автора: то, что 17-гигабайтный файл способен на всё перечисленное, рисование, работу с изображениями, кодинг-агентов, впечатляющий прогресс локальных моделей: год назад такой уровень был бы конкурентен с лучшими и самыми дорогими проприетарными моделями. Единственное, что мешает сделать Qwen 3.8 27B моделью на каждый день, производительность: как плотная (не Mixture-of-Experts) архитектура, она требовательна к пропускной способности памяти, а обе доступные автору машины не показывают в этом параметре топовых результатов.

Ключевые факты

  • Qwen 3.8 27B, модель с открытыми весами (Apache 2.0) на 27 млрд параметров с поддержкой изображений от лаборатории Qwen (Alibaba); квантованная сборка Q4_K_M весит 17 ГБ на диске.
  • По умолчанию модель использует уровень рассуждений xhigh: SVG с пеликаном на велосипеде заняла 21 минуту и 22 276 токенов размышлений против 137 секунд без рассуждений.
  • Модель точно находит bounding box объектов на фото и способна вести цикл кодинг-агента, протестирована с агентом Pi через LM Studio на NVIDIA DGX Spark.
  • Скорость генерации, 15, 30 токенов в секунду, заметно медленнее облачных моделей (OpenAI 5.6 Sol, 74 токена/с, 5.6 Luna, 184 токена/с по данным Artificial Analysis).
  • Запуск через llama.cpp с флагом --spec-type draft-mtp (техника Multi-Token Prediction) ускорил вывод на Spark примерно на 72% по сравнению со сборкой LM Studio по умолчанию.

Почему это важно

Qwen 3.8 27B показывает, что модель весом всего 17 ГБ на диске способна конкурировать по возможностям, рисование SVG, работа с изображениями, ведение агентного кодинга, с лучшими проприетарными моделями недавнего прошлого, при этом помещаясь на обычный ноутбук или компактный ИИ-компьютер вроде DGX Spark.

Кому это важно

Разработчикам и энтузиастам, которые запускают языковые модели локально на своём железе (Mac с достаточным объёмом памяти, DGX Spark и подобные устройства), а также тем, кто настраивает локальные кодинг-агенты вроде Pi поверх открытых моделей.

Как это применить

Не запускать модель с настройками по умолчанию: уровень рассуждений xhigh превращает даже простые запросы («нарисуй SVG-круг») в многоминутную переработку, автор советует сразу переключаться на low или отключать рассуждения вовсе. Также стоит поднять лимит контекста в LM Studio выше значения по умолчанию (8192 токена) до максимума модели (262 144), иначе она успевает исчерпать контекст на самих рассуждениях. Для ускорения вывода можно запускать модель через llama.cpp с флагом --spec-type draft-mtp, задействующим Multi-Token Prediction, это дало прирост скорости около 72% на тестовом железе.

Можно ли доверять

Автор приводит собственные наблюдения с конкретными транскриптами рассуждений, временем генерации и числом токенов, но подчёркивает: независимых бенчмарков модели ещё не было, в открытом доступе есть только собственные, самостоятельно опубликованные показатели Qwen.

Риски и подводные камни

Помимо избыточных раздумий, модель плотная (не Mixture-of-Experts), поэтому требовательна к пропускной способности памяти, и на доступном автору железе выдаёт лишь 15, 30 токенов в секунду, заметно медленнее облачных аналогов. Без включённых рассуждений собственный инструмент, который модель написала для визуализации bounding box, не заработал корректно с первого раза: рамки отображались не в тех местах.

«Это нелепая настройка по умолчанию. Она совершенно не годится для запуска модели, особенно на потребительском железе.»

— из обзора Qwen 3.8 27B на simonwillison.net