Liquid AI выпустила Q4_0-чекпоинты LFM2.5, восстановив 97% точности, потерянной при квантовании

Liquid AI выпустила Q4_0-чекпоинты LFM2.5, восстановив 97% точности, потерянной при квантовании

Liquid AI выпустила квантованные чекпоинты в формате Q4_0 для четырёх моделей линейки LFM2.5, LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B. Чекпоинты обучены новым методом, который компания называет Quantization-Aware Distillation (QAD, «дистилляция с учётом квантования»): вместо привычного квантования после обучения (post-training quantization, PTQ), когда уже готовую модель в высокой точности (BF16) просто ужимают до низкой точности постфактум, здесь модель-учитель в высокой точности (BF16) сразу дистиллируется в модель-ученика в формате Q4_0, квантование закладывается в процесс обучения, а не применяется к готовой модели задним числом.

По заявлению компании, такой подход восстанавливает 97% точности, которую модели обычно теряют при квантовании до Q4_0 по сравнению с полноточной BF16-версией, это агрегированная цифра по всем четырём моделям сразу. Отдельно для каждой модели, в том порядке, в котором они перечислены в остальном тексте поста (LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, LFM2.5-2.6B), новые Q4_0-чекпоинты сохранили 97,1%, 96,5%, 97,4% и 96,6% точности своей BF16-версии соответственно. Это отдельная метрика: не доля отыгранных назад потерь, а доля исходного качества BF16, которая осталась в сжатой модели. Точность измерялась на бенчмарках рассуждений, следования инструкциям, использования инструментов и агентных сценариев, GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF и BFCLv4, плюс по одному математическому тесту на класс моделей: GSM8K для LFM2.5-230M и LFM2.5-350M, AIME25, для LFM2.5-1.2B-Instruct и LFM2.5-2.6B. Каждый результат, среднее по пяти прогонам; полноточная BF16-версия GGUF использовалась как потолок качества в этом формате, а сравнение шло с собственными же GGUF-чекпоинтами компании, полученными обычным PTQ.

На реальном периферийном (edge) оборудовании, MacBook Pro, мини-ПК NucBox EVO-X2 (оба через GPU-инференс), смартфоне Samsung Galaxy S26 Ultra и Raspberry Pi 5 (оба через Arm CPU-инференс), новые Q4_0-чекпоинты LFM2.5-230M и LFM2.5-350M сравнялись по качеству (в пределах погрешности измерений) с более тяжёлым форматом Q5_K_M, но выдают на 4, 33% более высокую скорость генерации токенов. Чекпоинты LFM2.5-1.2B-Instruct и LFM2.5-2.6B сравнялись по качеству с Q4_K_M при скорости на 3, 14% выше. Там, где сравнение приведено, для LFM2.5-230M и LFM2.5-1.2B, новые чекпоинты также сравнялись по качеству с UD-Q4_K_XL от Unsloth, который в посте называют сильным внешним PTQ-чекпоинтом.

Все четыре чекпоинта уже доступны на Hugging Face и совместимы с llama.cpp и любым другим движком, который поддерживает формат GGUF Q4_0; в посте приведён пример запуска через утилиту командной строки llama-cli. Пост опубликован от имени компании Liquid AI, при этом указаны имена авторов, Адитья Тадимети и Леони Монигатти, а собственная библиографическая ссылка поста называет только месяц публикации (август 2026 года) без точной даты.

Ключевые факты

  • Liquid AI выпустила Q4_0-чекпоинты четырёх моделей линейки LFM2.5, LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B, обученные методом Quantization-Aware Distillation (QAD) вместо обычного квантования после обучения (PTQ).
  • QAD восстанавливает 97% точности, которую модели теряют при квантовании до Q4_0 по сравнению с полноточной BF16-версией, это усреднённая цифра по всем четырём моделям.
  • По отдельным моделям (в порядке LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, LFM2.5-2.6B) новые чекпоинты сохранили 97,1%, 96,5%, 97,4% и 96,6% точности своей BF16-версии на бенчмарках рассуждений, следования инструкциям, использования инструментов, агентных сценариев и математики (GSM8K/AIME25).
  • На реальных устройствах, MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5, младшие модели (230M, 350M) сравнялись по качеству с форматом Q5_K_M при скорости генерации на 4, 33% выше, старшие (1.2B-Instruct, 2.6B), с Q4_K_M при скорости на 3, 14% выше.
  • Все чекпоинты уже доступны на Hugging Face и совместимы с llama.cpp и другими движками, поддерживающими GGUF Q4_0; в посте есть готовый пример команды запуска.

Почему это важно

Квантование, стандартный способ уместить модель в ограниченную память и ускорить инференс, но обычно оно платит точностью: чем ниже точность весов, тем больше модель теряет в качестве по сравнению с полноточной BF16-версией. Пост показывает, что эту потерю можно почти полностью отыграть назад не за счёт более тяжёлого формата, а за счёт того, как модель обучена: если дистиллировать модель-ученика сразу в квантованном виде (QAD), а не квантовать уже готовую полноточную модель постфактум (обычное квантование после обучения, PTQ), итоговое качество оказывается заметно ближе к BF16-версии, при той же памяти и скорости формата Q4_0. Сам пост в своей библиографической ссылке описывает метод как предназначенный «для периферийных развёртываний» (for Edge Deployment): для моделей размером от 230 миллионов до 2,6 миллиарда параметров, где каждый процент точности и каждый мегабайт на счету, такой прирост качества без потери скорости и компактности расширяет допустимый компромисс между размером модели и её пригодностью для реальных задач.

Кому это важно

Разработчикам, которые запускают LLM локально или на периферийных устройствах, смартфонах, мини-ПК, одноплатных компьютерах вроде Raspberry Pi, и вынуждены агрессивно квантовать модель, чтобы она вообще поместилась в память и работала с приемлемой скоростью: релиз даёт готовые чекпоинты и конкретные цифры того, сколько качества эта техника возвращает по сравнению с обычным квантованием после обучения (PTQ). Инженерам, которые выбирают между схемами квантования (Q4_0, Q5_K_M, Q4_K_M) и до сих пор жертвовали либо качеством ради размера модели, либо размером ради качества, новые чекпоинты предлагают вариант, где этот выбор не так критичен. Командам, которые сами обучают компактные модели для периферийных сценариев, релиз даёт рабочий пример метода: QAD показывает жизнеспособный путь дистилляции под целевую разрядность квантования, а не только конкретный результат для LFM2.5.

Как это применить

Все четыре чекпоинта, LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B в формате Q4_0, уже выложены на Hugging Face и совместимы с llama.cpp или любым другим движком, который поддерживает формат GGUF Q4_0. В посте приведён готовый пример запуска через утилиту командной строки llama-cli с указанием репозитория модели и конкретного файла чекпоинта. Там, где применимо (для LFM2.5-230M и LFM2.5-1.2B), новые чекпоинты по качеству также сравнялись с UD-Q4_K_XL, сборкой от Unsloth, которую пост называет сильным внешним PTQ-чекпоинтом. Ни цена, ни лицензионные условия, ни точный размер файлов в посте не приведены, только сами чекпоинты и инструкция по запуску.

Можно ли доверять

Пост опубликован Liquid AI от имени компании, при этом указаны имена авторов, Адитья Тадимети и Леони Монигатти, на собственном блоге на Hugging Face; то есть все цифры о качестве и скорости не проходили независимую проверку и исходят от самого разработчика тестируемых моделей. При этом методология описана достаточно прозрачно: перечислен состав бенчмарков (GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4, плюс GSM8K или AIME25 по масштабу модели), указано усреднение по пяти прогонам, а сравнение шло и с собственными PTQ-чекпоинтами компании, и, где применимо, с внешним чекпоинтом UD-Q4_K_XL от Unsloth. При этом абсолютных чисел (баллов бенчмарков, скорости в токенах в секунду) в посте нет, только относительные проценты, что затрудняет независимую проверку итоговых цифр читателем. Точная дата публикации у поста есть, 19 августа 2026 года, а вот собственная библиографическая ссылка поста называет только месяц, август 2026 года.

Риски и подводные камни

Все цифры в посте, от самой Liquid AI, без независимого воспроизведения, и приведены в основном в относительном виде: абсолютных баллов по бенчмаркам и абсолютной скорости в токенах в секунду в посте нет, только проценты и диапазоны, которые сложно проверить самостоятельно. Сам пост не называет число, которое показывало бы, насколько обычное квантование после обучения (PTQ) отстаёт от QAD в тех же единицах, сказано лишь, что QAD «существенно улучшает» PTQ-чекпоинт, без опорного числа для сравнения. Сравнение ограничено собственными моделями Liquid AI и одним внешним чекпоинтом от Unsloth, сопоставления с другими семействами открытых моделей (например, Llama, Mistral, Gemma, Qwen) в посте нет. Наконец, заявленные 97% восстановленной точности (агрегированная цифра по всем четырём моделям) и 96,5, 97,4% сохранённой точности (по отдельным моделям), это две разные метрики, которые легко перепутать при пересказе: первая, доля отыгранных назад потерь, вторая, доля исходного качества BF16, оставшаяся в сжатой модели.