Unsloth выпустила Dynamic v3.0: GGUF-кванты точнее конкурентов на 10% при том же размере

Компания Unsloth, разработчик инструментов для квантования и дообучения языковых моделей с открытым кодом, выпустила Dynamic v3.0, новую версию своего метода GGUF-квантования, которая приходит на смену Dynamic v2.0 и уточняет более раннюю предварительную (early preview) версию v3.0, которую Unsloth уже показывала ранее. Вместе с методом компания выпустила первые кванты на его основе, для модели Qwen3.8-27B. По заявлению Unsloth, при том же размере файла эти кванты более чем на 10% точнее по метрике top-1%, чем кванты любого другого поставщика. Новые GGUF-файлы совместимы с большинством движков инференса, включая llama.cpp и Unsloth Desktop. Отдельно компания сообщила, что кванты Qwen3.8 от Unsloth уже скачали более 5,1 млн раз за 5 дней.
В основе Dynamic v3.0, обновлённая методология: более качественный калибровочный imatrix-датасет, собранный из разных источников и заточенный под агентный кодинг, чат и многоязычные сценарии; улучшенный выбор слоёв для квантования и больше техник квантования, чтобы точнее сохранять качество модели. Компания подчёркивает, что не обучает модель на калибровочном датасете и не применяет техники обучения с учётом квантования (QAT/QAD), всё квантование выполняется посттренировочно (PTQ, post-training quantization). Сам файл imatrix выложен в открытый доступ: сообщество может тестировать его, оценивать и использовать, в том числе для собственных вариаций и дообучения Qwen3.8 поверх квантов Unsloth.
Среди конкретных версий: из младших квантов (у порога UD-Q2_K_XL, 8,37 ГБ, и меньше) убрали модуль MTP, это экономит около 500 МБ на диске; при необходимости его можно подключить отдельно как модуль Q4_0 MTP. Появились и более компактные 1-битные кванты: UD-IQ1_S весит 6,2 ГБ без MTP, сохраняет около 72% точности top-1% и при этом на 89% меньше. UD-Q2_K_XL, по данным компании, весит 9,83 ГБ и примерно на +8% точнее по top-1%, чем ближайший из конкурирующих квантов; в качестве иллюстрации Unsloth отмечает, что эта версия сумела собрать рабочую HTML-страницу с одной небольшой ошибкой в JS, тогда как раньше получался нерабочий код.
Чтобы точнее измерять качество квантования, Unsloth вводит новую метрику Divergence-300 @32. Обычно top-1%-точность приводят как есть, например, для модели Kimi-K3 компания ранее заявляла ~78,9% top-1-точности при уменьшении размера на 62% (это пример методологии на другой модели, а не показатель по Qwen3.8). Но, по мнению Unsloth, top-1%, это, по сути, argmax по одному предсказанию, и он плохо отражает реальное качество генерации. Поэтому компания собрала 300 отложенных примеров, не входящих в калибровочный датасет, из Terminal-Bench 2.1, DeepSWE, Harbor, MathArena 2025, 26 и запросов не на латинице или с длинными документами, и прогнала жадное (greedy) argmax-декодирование на 32 токена, сравнивая версию BF16 со всеми квантами и поставщиками. Такой подход расширяет KL-дивергенцию по top-1% на 32 токена вместо одного предсказания; Unsloth считает его более показательной метрикой и заодно способом проверки квантов на переобучение.
По итогам KL-дивергентных тестов по всем поставщикам (с отчётом по top-1% и средней KL-дивергенции) Unsloth заявляет, что её кванты UD-3 на всех уровнях, особенно на меньших размерах, получают до +10% дополнительной top-1%-точности при том же объёме диска; при расчёте размера на диске из сравнения намеренно исключили вес модуля MTP, чтобы сопоставление было честным для всех участников.
Отдельно компания разбирает риск переобучения под тестовые данные. На отложенных Wikitext и коде новая методика даёт заметное улучшение KL-дивергенции для мелких квантов, но не для крупных, поэтому для больших квантов Unsloth пока продолжает использовать прежний метод UD-2, а не Dynamic v3.0, и планирует доработать их отдельно. Для контроля переобучения компания использует полностью разные датасеты для калибровки и для тестирования, убирая пересечения между ними, а KL-дивергенцию проверяет именно на отложенных данных. Поскольку применяется только посттренировочное квантование (PTQ), а не QAT/QAD, риск переобучения, по словам Unsloth, ниже, чем у альтернативных подходов; тот же вывод, по заявлению компании, подтверждает и датасет Divergence-300 @32, новая методика UD-3 переобучения не показывает.
Ключевые факты
- Unsloth выпустила Dynamic v3.0, новую версию метода GGUF-квантования, и первые кванты на его основе для модели Qwen3.8-27B.
- По заявлению компании, при том же размере файла эти кванты более чем на 10% точнее по top-1%-точности, чем у любого другого поставщика; кванты Qwen3.8 уже скачали свыше 5,1 млн раз за 5 дней.
- Из младших квантов (порог UD-Q2_K_XL, 8,37 ГБ и меньше) убрали модуль MTP, экономия около 500 МБ; появился 1-битный UD-IQ1_S весом 6,2 ГБ с ~72% точности top-1% при уменьшении размера на 89%.
- Компания вводит новую метрику Divergence-300 @32, 300 отложенных примеров и жадное 32-токенное декодирование вместо ненадёжной, по её мнению, top-1%-точности.
- Квантование выполняется без обучения на калибровочных данных и без QAT/QAD (только посттренировочно, PTQ); imatrix-файл открыт для сообщества, но для крупных квантов Unsloth пока использует прежний метод UD-2, а не v3.0.
Почему это важно
Квантование, стандартный способ уместить большую языковую модель в ограниченную память локального устройства, но при сжатии часть точности модели неизбежно теряется. Dynamic v3.0 обещает более выгодный компромисс: по заявлению Unsloth, при том же размере файла её кванты Qwen3.8-27B точнее конкурирующих больше чем на 10% по top-1%-точности. Отдельно важна методологическая часть: компания указывает на слабость top-1%-точности как метрики (по сути, это argmax на одном предсказании) и предлагает Divergence-300 @32, оценку по нескольким токенам подряд и на данных, не входивших в калибровку. Если такой подход приживётся, он может изменить то, как индустрия в целом сравнивает качество разных методов квантования.
Кому это важно
В первую очередь, разработчикам и энтузиастам, которые запускают большие языковые модели локально через llama.cpp или Unsloth Desktop при ограниченной видеопамяти или ОЗУ: именно они выбирают конкретный уровень квантования, от 9,83 ГБ у UD-Q2_K_XL до 6,2 ГБ у 1-битного UD-IQ1_S, исходя из баланса между размером и точностью. Важно это и тем, кто уже работает с моделью Qwen3.8: открытый imatrix-файл Unsloth можно использовать для собственных вариаций и дообучения. И отдельно, исследователям, которые изучают методы оценки качества квантования и защиту от переобучения на тестовых данных.
Как это применить
Новые GGUF-кванты Qwen3.8-27B по методу Dynamic v3.0 можно скачать и сразу запускать в llama.cpp или Unsloth Desktop, без специальной настройки под движок. Если критичен каждый гигабайт, стоит взять версии с уже убранным модулем MTP (UD-Q2_K_XL и меньше, экономия около 500 МБ) или самый компактный 1-битный UD-IQ1_S (6,2 ГБ, ~72% точности top-1%); если MTP всё же нужен, его можно подключить отдельным модулем Q4_0. Использованный при квантовании imatrix-файл открыт: его можно взять для собственного тестирования, оценки или для запуска квантования и дообучения Qwen3.8. Источник не называет цену или лицензионные условия, материал описывает только сам релиз квантов и методологию их создания.
Можно ли доверять
Все ключевые цифры в материале, оценки самой Unsloth про собственный продукт, без независимой проверки: и «более чем на 10% точнее любого другого поставщика», и «до +10% на тех же размерах» опубликованы компанией-разработчиком, а конкретные конкурирующие кванты, с которыми идёт сравнение («ближайший конкурент»), по именам не названы. При этом Unsloth раскрывает методологию подробнее, чем типичный анонс: отдельные датасеты для калибровки и для теста, проверка именно на отложенных данных, отказ от QAT/QAD в пользу посттренировочного квантования как раз для снижения риска переобучения, и отдельная метрика Divergence-300 @32 на 300 отложенных примерах. Открытый imatrix-файл в принципе позволяет сообществу перепроверить часть заявлений самостоятельно, но в самом материале независимого воспроизведения тестов нет, все графики и цифры приведены со стороны Unsloth.
Риски и подводные камни
Прирост качества по Dynamic v3.0 пока подтверждён не для всех размеров: на крупных квантах, по признанию самой Unsloth, KL-дивергенция улучшилась незначительно, поэтому для них компания продолжает использовать более старый метод UD-2, а не v3.0, доработку обещают позже. У части цифр в материале не до конца ясна база сравнения: «на 89% меньше» для UD-IQ1_S и «на 62% меньше» для примера с Kimi-K3 не поясняют в этом же месте текста, меньше чего именно. Есть и внутренняя нестыковка в самом источнике: UD-Q2_K_XL один раз назван квантом «8,37 ГБ и меньше» (порог, ниже которого убирали MTP), а в другом месте того же текста его размер указан как 9,83 ГБ, Unsloth это расхождение не поясняет, здесь обе цифры приведены как в источнике. Наконец, страница Unsloth совмещает свежий релиз Dynamic v3.0 со старым архивным разделом Dynamic v2.0 с обновлениями за 2025, 2026 годы, это живой, регулярно дополняемый документ, а не разовый пресс-релиз с одной фиксированной датой.