Multiverse Computing сжала GPT-OSS 120B до 4 бит, модель обошла оригинал

Компания Multiverse Computing опубликовала статью о методе Quantization-Aware Healing (QAH), способе «лечить» модель, которую уже подвергли и структурному сжатию (уменьшению числа слоёв, голов внимания или нейронов), и квантованию (переводу весов в низкую разрядность). Метод применили к модели GPT-OSS 120B: её сжали до 60 млрд параметров, а затем перевели в 4-битный формат MXFP4. Результат сравнили с восстановленной 16-битной (bfloat16) версией той же 60-миллиардной модели, и 4-битная версия обошла её на 7 из 9 тестов. На двух тестах, где она уступила (MMLU-Pro и SciCode), отставание составило меньше полутора баллов. Наибольший выигрыш пришёлся именно на те способности, которые сжатие обычно повреждает сильнее всего: работа с длинным контекстом (+7,4 на тесте AA-LCR) и математика (+5,6 на AIME 2025). При сравнении с исходной 120-миллиардной моделью-«учителем» 4-битная модель, работая вдвое меньшим числом параметров и примерно с четвертью объёма памяти под веса, обогнала её на LiveCodeBench (66,5 против 66,0) и почти сравнялась на GPQA Diamond (67,4 против 69,0), отстав всего на 1,6 балла.
Авторы объясняют, почему обычные методы «лечения» здесь не работают. Стандартный приём, квантование с учётом обучения (QAT): в модель встраивают операции псевдоквантования и дообучают её на целевой функции потерь, заново прогоняя дорогой процесс дообучения через более шумный низкоточный проход. Это дорого и, по данным авторов, может стать нестабильным, если обучение продолжается слишком долго после точки максимума. Альтернатива, дистилляция с учётом квантования (QAD): вместо функции потерь по задаче используют дистилляцию от замороженной полноточной модели-учителя через KL-дивергенцию на логитах. Этот приём хорошо работает, когда единственное изменение, квантование, ведь существует независимая полноточная версия той же архитектуры. Но если модель уже прошла структурное сжатие, независимой полноточной версии уменьшенной архитектуры не существует, единственный кандидат в учителя это сам восстановленный bfloat16-чекпоинт, который уже является приближением к оригиналу. Дистилляция от него ограничивает точность студента потолком этого чекпоинта.
QAH снимает это ограничение одним изменением: дистилляция идёт напрямую от исходной, ещё не сжатой модели, а не от восстановленного чекпоинта. Учитель и студент даже не делят архитектуру, учитель полноразмерный и полноточный, студент вдвое меньше и работает в MXFP4; студент не видит жёстких меток, только распределение выходов учителя через KL-дивергенцию на логитах. Тем самым этап квантования перестаёт быть просто потерей качества после восстановления и становится вторым полноценным проходом дистилляции от исходного учителя, тем обучением, которого не получил bfloat16-чекпоинт. Есть и бонус по стабильности: поскольку KL-дистилляция привязывает студента к фиксированному распределению учителя, после того как студент его догоняет, дальше двигаться некуда, тогда как функция потерь по жёстким меткам продолжает толкать модель дальше и со временем портит качество. Для работы с длинным контекстом (документы до 32 тысяч токенов) авторы используют экономную по памяти «чанковую» KL-дивергенцию из своей предыдущей статьи, она считает KL по частям последовательности, не строя целиком матрицу «словарь на длину последовательности», что и позволяет уместить обучение на 32k токенах в фиксированный бюджет памяти GPU.
В прямом сравнении QAH и QAT на модели GPT-OSS 9B (усреднённый результат по MMLU-Pro, LiveCodeBench и GPQA Diamond) оба метода достигли близкого пика точности, 54,9 у QAH против 54,6 у QAT, но по-разному. QAH достиг пика примерно за 100 шагов обучения (примерно в 7 раз быстрее QAT, которому потребовалось около 700 шагов) и затем удерживался в пределах двух баллов от пика до конца обучения. QAT же после своего пика резко просел, потеряв почти 19 баллов к 1200-му шагу. Практический вывод: чекпоинт QAT требует аккуратной ранней остановки по отложенной выборке, чтобы не отправить в прод уже деградировавшую модель, тогда как достаточно обученный чекпоинт QAH можно безопасно разворачивать, поскольку он не «уплывает» со временем.
Экономический эффект складывается с эффектом по качеству: 4-битная QAH-модель использует примерно в 4 раза меньше памяти под веса, чем bfloat16-версия того же 60-миллиардного студента, а за счёт вдвое меньшего числа параметров относительно 120-миллиардного учителя вычислений на токен требуется примерно вдвое меньше. Для семейств моделей, которые изначально поставляются в bfloat16, а не в 4-бит, совокупное сокращение (по параметрам и по точности) даёт снижение вычислений на токен почти в 8 раз. Статья не называет имена конкретных авторов (материал написан от коллективного «мы» Multiverse Computing), не приводит дату публикации, не сообщает, кто создал исходную модель GPT-OSS 120B, не называет ни долларовую стоимость обучения, ни затраты в GPU-часах, и не говорит, будут ли выложены веса или код QAH-модели.
Ключевые факты
- Multiverse Computing представила метод Quantization-Aware Healing (QAH) для восстановления моделей, прошедших и структурное сжатие, и квантование
- GPT-OSS 120B сжали до 60 млрд параметров и перевели в 4-бит MXFP4, итоговая модель обошла свою же 16-битную (bfloat16) версию на 7 из 9 тестов
- Наибольший прирост, на длинном контексте (+7,4 на AA-LCR) и математике (+5,6 на AIME 2025); против исходного 120-миллиардного учителя модель выигрывает на LiveCodeBench (66,5 против 66,0)
- В прямом сравнении с квантованием с учётом обучения (QAT) на модели GPT-OSS 9B: QAH достиг пика точности (54,9) за 100 шагов и не деградировал дальше, тогда как QAT потерял почти 19 баллов к 1200-му шагу после своего пика (54,6)
- 4-битная модель требует примерно в 4 раза меньше памяти под веса, чем 16-битная версия того же студента, и вдвое меньше вычислений на токен относительно исходного учителя
Почему это важно
До сих пор считалось, что 4-битная модель по определению уступает своей полноточной версии, квантование тратит часть точности, которую последующее «лечение» пытается вернуть. QAH переворачивает эту логику: дистилляция напрямую от исходной, ещё не сжатой модели превращает квантование из потери в дополнительный этап обучения, и итоговая 4-битная модель обходит свой же 16-битный чекпоинт на большинстве тестов, а не просто приближается к нему.
Кому это важно
Тем, кто занимается сжатием и разворачиванием больших языковых моделей: инженерным командам, которым нужно уместить модель в меньший объём памяти и вычислений без потери качества, и исследователям, работающим над квантованием и дистилляцией. Разработчикам инфраструктуры для инференса метод интересен как способ снизить требования к железу без обычного компромисса по точности.
Как это применить
QAH требует доступа к исходной полноразмерной и полноточной модели как к учителю, метод неприменим, если такой модели нет. Для длинного контекста (документы до 32 тысяч токенов) нужна экономная по памяти реализация KL-дивергенции, которую авторы уже описали в предыдущей статье о дистилляции. Статья не сообщает ни о доступности весов или кода QAH-модели, ни о стоимости обучения в деньгах или GPU-часах, только число шагов обучения и разницу в баллах тестов.
Можно ли доверять
Материал опубликован самой компанией-разработчиком (Multiverse Computing) на её собственном блоге на Hugging Face, а не в независимо рецензируемом издании, поэтому результаты приведены авторами и не подтверждены сторонней проверкой. Методология описана подробно, конкретные модели (GPT-OSS 120B и 9B), тесты (MMLU-Pro, LiveCodeBench, GPQA Diamond, AA-LCR, AIME 2025, SciCode) и числа приведены по пунктам, что позволяет проверить заявления, если результаты будут воспроизведены независимо.
Риски и подводные камни
Метод проверен на одном семействе моделей (GPT-OSS) и на конкретной паре размеров (120B и 60B, отдельно 9B), неясно, насколько результат переносится на другие архитектуры. На двух из девяти тестов (MMLU-Pro и SciCode) 4-битная модель всё же уступает, а по самому сложному тесту на длинный контекст (AA-LCR) отставание от исходного 120-миллиардного учителя остаётся наибольшим. Статья не раскрывает стоимость обучения в деньгах или GPU-часах и не говорит, будут ли открыты веса или код.