ByteShape выпустила полные квантизации Qwen 3.8 27B: сравнила с Lite и конкурентами

Qwen 3.8 27B вышла 14 августа 2026 года. Уже 18 августа, через четыре дня, компания ByteShape выпустила первый набор GGUF-квантизаций под названием ShapeLearn-Lite, с меньшим бюджетом оптимизации, меньшим числом проверок и без долгого ожидания. Теперь готов полный набор ShapeLearn, пять моделей, и ByteShape опубликовала их сравнение с Lite-версией и с квантизациями других команд: Unsloth (Dynamic v3), ISTA-DASLab, Bartowski и AtomicChat. Модели Bartowski вышли уже после того, как тестирование ByteShape завершилось, поэтому в сравнение не попали.
Тестирование прошло на шести видеокартах, от RTX 5060 Ti и RTX 4080 (16 ГБ) до RTX 4090 и RTX 3090 (24 ГБ), RTX 5090 (32 ГБ) и RTX Pro 6000 (96 ГБ). На всех шести все пять моделей полного ShapeLearn легли на границу соотношения «скорость/качество», то есть среди сравниваемых квантизаций не нашлось ни одной, которая была бы одновременно и быстрее, и точнее любой из них. Модель ISTA-DASLab тоже оказалась на этой границе.
В качестве варианта по умолчанию ByteShape рекомендует модель GPU-5: она весит 13,1 ГБ и достигает 99,63% агрегированного балла BF16-версии (на RTX Pro 6000, 90,4 ток/с, на RTX 5090, 93,7 ток/с, на RTX 4090, 59,2 ток/с). Если GPU-5 не помещается в память с нужным контекстом, ByteShape советует модель GPU-4: она весит 11,0 ГБ, набирает 98,72% BF16 и быстрее. На RTX 3090 GPU-4 даёт 49,5 ток/с против 45,8 ток/с у GPU-5, переход на более крупную модель стоит около 7,5% скорости ради роста качества с 98,72% до 99,63% BF16. На RTX 4080 GPU-4 даёт 52,4 ток/с, GPU-5, 45,7 ток/с; на RTX 5060 Ti в том же порядке, 33,1 и 29,1 ток/с.
Отдельно ByteShape вернулась к судьбе Lite-версии. После её выхода Unsloth выпустила свои модели Dynamic v3, и на первый взгляд некоторые из них выглядели точнее: например, у модели Unsloth UD-IQ3_S метрика KLD (расхождение распределения предсказаний квантованной модели с эталонной BF16) оказалась примерно на 20% ниже, чем у самой маленькой модели Lite (Lite-1), 0,028759 против 0,035875. Но при этом итоговый агрегированный балл на бенчмарках у Lite-1 оказался выше, 97,33% против 95,55% BF16 у Unsloth-модели. ByteShape делает вывод: более низкий KLD не гарантирует более высокого практического качества, ранжирование по точности воспроизведения распределения, не то же самое, что ранжирование по результату на задачах; связанная статья компании об этом принята в индустриальный трек конференции EMNLP. На графике для RTX Pro 6000 три из шести моделей Lite (три самые маленькие) и три из двенадцати моделей Unsloth (UD-IQ2_S, UD-Q2_K_XL и UD-IQ4_XS) оказались на общей границе «скорость/качество»; после добавления пяти моделей полного ShapeLearn они заняли всю эту границу целиком.
ByteShape также протестировала спекулятивное декодирование двумя способами: MTP (голова черновика встроена в каждый GGUF-файл, добавляет к весу модели около 250 МБ, но загружается в память только если метод включён) и DFlash2 (отдельная черновая модель весом около 1,1 ГБ, требует llama.cpp версии b10658 или новее и не поддерживает изображения). Тестировали с 3 черновыми токенами для MTP и 7, для DFlash2, на смеси задач по агентному кодингу, математике и общим знаниям, с параметрами сэмплирования, которые Qwen рекомендует для режима размышления. Оба метода ускорили все пять моделей на всех шести видеокартах: DFlash2 обычно быстрее и даёт прирост в 1,34, 2,10 раза к базовой скорости без спекулятивного декодирования, MTP, в 1,28, 1,66 раза. ByteShape советует DFlash2, когда важна максимальная скорость на тексте и хватает памяти, и MTP, когда важнее экономия VRAM или поддержка изображений.
Методика: инструкционные модели проверялись на GSM8K (математика), IFEval (следование инструкциям), MMLU (общие знания), LiveCodeBench V6 (кодинг, задачи с 1 января 2024 года и позже), Multi-IF (многоходовые и многоязычные инструкции) и ACEBench (инструменты и агентные задачи); «думающие» модели, на ACEBench, серии HumanEval и восьми поднаборах BFCL V4 (вызов инструментов и агентные сценарии), с включённым средним уровнем размышления Qwen. Балл каждой квантованной модели по каждому бенчмарку нормировали на балл соответствующей BF16-модели, итоговый показатель, среднее по всем бенчмаркам. Всё тестирование прошло на llama.cpp версии b10430.
Ключевые факты
- ByteShape выпустила полный набор ShapeLearn-квантизаций Qwen 3.8 27B (пять моделей), вслед за выходом самой Qwen 3.8 27B (14 августа 2026) и быстрой версии ShapeLearn-Lite (18 августа 2026).
- На всех шести протестированных GPU (16, 96 ГБ) все пять моделей полного ShapeLearn лежат на границе «скорость/качество», быстрее или точнее них среди сравниваемых квантизаций (Unsloth Dynamic v3, ISTA-DASLab, Bartowski, AtomicChat) не нашлось.
- Модель по умолчанию GPU-5 (13,1 ГБ) даёт 99,63% качества BF16-версии; более компактная GPU-4 (11,0 ГБ), 98,72% при более высокой скорости.
- Спекулятивное декодирование ускоряет все модели на всех GPU: DFlash2, в 1,34, 2,10 раза, MTP, в 1,28, 1,66 раза; DFlash2 требует больше памяти и не работает с изображениями.
- У модели Unsloth UD-IQ3_S метрика KLD была на 20% ниже, чем у Lite-версии ByteShape, но реальный балл на бенчмарках у Lite оказался выше (97,33% против 95,55% BF16), низкий KLD не гарантирует практического качества.
Почему это важно
Квантизация, способ сжать большую модель под память обычной видеокарты почти без потери качества, и рынок таких сжатых версий одной и той же модели уже конкурентный: над Qwen 3.8 27B параллельно работают минимум пять команд (ByteShape, Unsloth, ISTA-DASLab, Bartowski, AtomicChat). ByteShape показывает не просто новый релиз, а построенную методику сравнения, шесть видеокарт, единый набор бенчмарков, нормировка на BF16-эталон, и на её основе оспаривает популярную метрику качества квантизации (KLD): низкое расхождение с эталоном не всегда означает лучший результат на реальных задачах.
Кому это важно
Тем, кто запускает большие языковые модели локально на своей видеокарте, от энтузиастов с RTX 4080/5060 Ti (16 ГБ) до владельцев более мощных RTX 4090/3090, RTX 5090 и профессиональной RTX Pro 6000 (96 ГБ), и выбирает, какую квантизацию Qwen 3.8 27B ставить. Также важно тем, кто занимается или интересуется квантизацией моделей как областью: статья прямо оспаривает практику полагаться на одну лишь метрику KLD при оценке качества сжатой модели.
Как это применить
Модели доступны в виде GGUF-файлов под тегом byteshape/Qwen3.8-27B-GGUF, запуск, через llama-server с указанием конкретного квантования (например, Qwen3.8-27B-IQ4_XS-3.84bpw). Голова MTP для спекулятивного декодирования уже встроена в каждый GGUF и включается флагом --spec-type draft-mtp; для DFlash2 нужна отдельная черновая модель (incoai/Qwen3.8-27B-DFlash2-GGUF) и версия llama.cpp не ниже b10658. При выборе модели ByteShape советует ориентироваться на GPU-5 как вариант по умолчанию и переходить на более компактную GPU-4, если не хватает памяти под нужную длину контекста, но оговаривается, что попадание модели в тестовые измерения не гарантирует, что при этом влезет любая длина контекста или конфигурация обслуживания.
Можно ли доверять
Это блог самой ByteShape, компании, которая делает и продвигает собственные квантизации, поэтому сравнение с конкурентами не независимое. При этом методика описана подробно и проверяемо: перечислен конкретный набор бенчмарков, версия llama.cpp для тестов (b10430), способ нормировки баллов на BF16-эталон и даже изменения в подсчёте KLD, которые ByteShape внесла сама. Компания также признаёт сильные стороны конкурентов (модель ISTA-DASLab на границе «скорость/качество», часть моделей Unsloth, тоже) вместо огульного превосходства над всеми. Автор поста как физическое лицо не указан, под материалом стоит только название компании.
Риски и подводные камни
DFlash2 требует более новую сборку llama.cpp (b10658+) и не поддерживает изображения, для мультимодальных сценариев остаётся только MTP. Цифры о выигрыше в скорости при спекулятивном декодировании получены с сэмплированием по температуре, а не жадным декодированием, сама ByteShape отмечает, что при жадном декодировании ускорение могло бы быть больше. Модели Bartowski, вышедшие уже после завершения тестов ByteShape, в сравнение не попали, так что оно неполное по составу конкурентов на момент публикации. Источник ничего не говорит о цене или условиях лицензирования моделей и обрывается на середине последнего предложения о рекомендации GPU-4.
«Дело не в том, что KLD бесполезен. Дело в том, что рейтинг по точности воспроизведения, не то же самое, что рейтинг по практической производительности на задачах.»
— ByteShape, в блоге компании