Gated DeltaNet пережил 4-битное квантование NVFP4 без потери качества

Gated DeltaNet пережил 4-битное квантование NVFP4 без потери качества

Гибридные большие языковые модели совмещают два типа слоёв: классическое внимание (softmax) и линейное внимание, например, Gated DeltaNet (GDN), чьё рекуррентное состояние обобщает весь контекст в блоке фиксированного размера. Когда сообщество энтузиастов делало первые 4-битные квантования модели Qwen3.8-27B (48 слоёв GDN и 16 слоёв внимания), блок GDN, особенно его вентили затухания и силы записи, оставляли в 8- или 16-битной точности. Логика была простой: ошибка в рекуррентном вычислении якобы накапливается на длинном контексте, поэтому такие слои считали самыми уязвимыми к огрублению точности.

Авторы проверили эту логику на практике и собрали Minima, версию той же модели, в которой в формат NVFP4 W4A4 (4 бита на веса и 4 бита на активации) переведены все 496 линейных слоёв, включая GDN. Модель прогнали по перплексии на контекстах 4K и 32K токенов, по тестам MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench и по поиску информации в контексте до 64K токенов (тест RULER). По пяти из этих задач среднее отставание Minima от эталонной BF16-версии, всего 0,52; авторы называют это уровнем шума между случайными запусками, а какие именно пять задач вошли в подсчёт, в тексте не указано. При этом чекпоинт Minima оказался самым лёгким среди сравненных вариантов квантования (17,5 GiB) и самым быстрым на этапе предзаполнения контекста (prefill), быстрее на 14, 19%; абсолютные цифры для других вариантов квантования в тексте не приводятся, только эти относительные показатели. Разрыв в перплексии на контексте 32K токенов с ростом позиции не увеличивается, а сокращается, то есть ошибка от квантования не накапливается на длинном контексте, а наоборот.

Авторы объясняют результат разбором механизма из четырёх пунктов. Во-первых, блочное масштабирование NVFP4 (по 16 элементов на блок) локализует выбросы в остаточном потоке модели и выравнивает ошибку активаций между разными ролями слоёв. Во-вторых, проекции вентилей, те самые, что считались самым хрупким местом, на деле оказались наименее чувствительны к квантованию: их параметризация через softplus/экспоненту и сигмоиду сжимает примерно 11% ошибки на уровне матричного умножения (GEMM) всего до 2% ошибки на выходе модели. В-третьих, дельта-правило, по которому обновляется рекуррентное состояние, держит внесённый шум на одном уровне на всём протяжении 32K токенов и стирает случайный сбой в состоянии за несколько сотен шагов, потому что каждая запись перезаписывает состояние вдоль направления текущего ключа. В-четвёртых, цена квантования на каждый токен с ростом контекста не накапливается, а размывается.

Отдельно команда устранила баг рассинхронизации глобального масштаба, который возникает, когда чекпоинты NVFP4 с калибровкой по отдельным модулям обслуживают ядра, объединяющие несколько модулей в одно матричное умножение, и показала, что калиброванные шкалы FP8 для KV-кэша ничего не стоят по производительности. Итоговый практический рецепт авторов простой: квантовать всё и заодно поставлять шкалы для KV-кэша. Главный вывод, рекуррентная половина гибридной модели оказалась не самой сложной, а самой лёгкой частью для квантования, вопреки исходной интуиции сообщества. Квантованный чекпоинт опубликован на Hugging Face (minima-ai/mnma_qwen3.8_27b_nvfp4).

Ключевые факты

  • Minima переводит в NVFP4 W4A4 все 496 линейных слоёв гибридной модели Qwen3.8-27B (48 слоёв Gated DeltaNet и 16 слоёв внимания), включая вентили GDN, которые раньше оставляли в 8- или 16-битной точности.
  • Качество почти не падает: по пяти из семи тестов среднее отставание от BF16-версии, всего 0,52, на уровне шума между случайными запусками; чекпоинт Minima при этом самый лёгкий (17,5 GiB) и самый быстрый на этапе предзаполнения контекста (prefill), быстрее на 14, 19%, среди сравненных вариантов.
  • Вентили, которые считались самым хрупким местом, оказались наименее чувствительны к квантованию: около 11% ошибки на уровне матричного умножения (GEMM) превращается всего в 2% ошибки на выходе модели.
  • Дельта-правило обновления рекуррентного состояния держит внесённый шум на одном уровне все 32K токенов и стирает случайный сбой в состоянии за несколько сотен шагов, ошибка от квантования с ростом контекста не накапливается.
  • Авторы отдельно устранили баг рассинхронизации масштаба при обслуживании через ядра, объединяющие несколько калиброванных модулей в одно матричное умножение, и показали, что калиброванные шкалы FP8 для KV-кэша ничего не стоят по скорости.

Почему это важно

До этой работы среди практиков было устойчивое мнение: рекуррентные слои вроде Gated DeltaNet нельзя жёстко квантовать, потому что ошибка в рекуррентном вычислении будет накапливаться с каждым шагом и на длинном контексте расползётся. Это исследование показывает обратное на конкретной гибридной модели: при аккуратном подходе (блочное масштабирование NVFP4, отдельная калибровка KV-кэша) именно рекуррентный блок держит 4-битное квантование не хуже, чем принято было думать, а качество модели по семи разным тестам почти не проседает. Это меняет расчёт для тех, кто проектирует и разворачивает гибридные архитектуры: сжимать можно агрессивнее, чем казалось, и не нужно оставлять рекуррентные слои «на всякий случай» в более высокой точности.

Кому это важно

Инженерам, которые обслуживают гибридные LLM (одновременно со слоями внимания и линейного внимания) в проде и считают каждый гигабайт видеопамяти и каждую миллисекунду задержки, квантование до 4 бит без потери качества снижает вес чекпоинта и ускоряет предзаполнение контекста. Разработчикам инструментов квантования и ядер для инференса, потому что в статье описан конкретный баг (рассинхронизация глобального масштаба при слиянии калиброванных по отдельности модулей в одно матричное умножение) и его исправление. Исследователям архитектур с гейтингом, потому что здесь дан механистический разбор того, почему именно эти вентили оказались устойчивы к огрублению точности.

Как это применить

Практический рецепт авторов простой: квантовать в NVFP4 W4A4 не только слои внимания, но и весь блок Gated DeltaNet целиком, включая вентили, не выделять их в отдельную, более точную ветку. Отдельно нужно откалибровать и поставлять шкалы FP8 для KV-кэша, по данным авторов, это ничего не стоит по производительности. Тем, кто обслуживает такие модели через ядра, объединяющие несколько калиброванных по отдельности модулей в одно матричное умножение, стоит учитывать баг с рассинхронизацией глобального масштаба, который авторы описали и исправили. Квантованный чекпоинт модели выложен на Hugging Face: minima-ai/mnma_qwen3.8_27b_nvfp4, рецепт можно проверить на практике.

Можно ли доверять

Результат проверен не на одной метрике, а сразу на семи разных тестах: перплексия на 4K и 32K токенах, MMLU-Pro, GSM8K, AIME'25, GPQA-Diamond, LiveCodeBench и поиск информации в контексте до 64K токенов (RULER), это снижает шанс, что улучшение оказалось случайностью одного теста. К результату приложен и механистический разбор из четырёх пунктов, а не только сырые цифры. При этом в тексте не названы ни авторы, ни организация, ни место и дата публикации, материал говорит о себе только «we» («мы»); не указано, какие именно пять задач вошли в средний показатель -0,52; а для конкурирующих вариантов квантования, с которыми сравнивают Minima, не приведено ни одной абсолютной цифры, только то, что Minima меньше и быстрее их. Материал по форме, техническая работа с экспериментами и разбором механизма, а не маркетинговый анонс, но отсутствие авторства и места публикации снижает степень внешней проверяемости результата.

Риски и подводные камни

Главное ограничение, источник обезличен: нет имён, института, конференции или даты публикации, только безличное «we». Результат пока нельзя сверить с репутацией конкретной научной группы или с рецензированием. Показатель -0,52 усреднён по пяти задачам, которые в тексте не перечислены поимённо, не видно, скрыт ли за средним провал по какому-то конкретному тесту. Сравнение с другими вариантами квантования дано только в относительных величинах («самый маленький», «на 14, 19% быстрее»), без абсолютных цифр по конкурентам сложно понять, насколько велик реальный разрыв. Наконец, всё показано на одной конкретной модели (Qwen3.8-27B с комбинацией 48 слоёв GDN и 16 слоёв внимания) и одном конкретном формате квантования (NVFP4 W4A4), прежде чем переносить вывод «рекуррентный блок легко квантовать» на другие архитектуры гейтинга или другие форматы квантования, стоит дождаться проверки на них.