Liquid AI выпустила LFM2.5-VL-DSpark для ускорения VLM LFM2.5-VL-3B

Liquid AI выпустила LFM2.5-VL-DSpark для ускорения VLM LFM2.5-VL-3B

Компания Liquid AI выпустила LFM2.5-VL-DSpark, вспомогательную модель-«черновик» (drafter) для своей визуально-языковой модели (VLM) LFM2.5-VL-3B. Черновик работает по технике спекулятивного декодирования: он предсказывает блок из нескольких токенов вперёд, а основная («целевая») модель проверяет и подтверждает эти предложения. Поскольку итоговый результат всегда сверяется целевой моделью, качество генерации не меняется, при жадном декодировании выход с черновиком и без него идентичен.

Драфт-модель использует ту же архитектуру, что и текстовые драфтеры семейства LFM2.5-DSpark: она считывает скрытые состояния целевой модели с фиксированного набора слоёв, а изображения и текст заранее проецируются в общее представление, так что алгоритм инференса не меняется в зависимости от типа входных данных. После абляций по 3, 4 и 5 слоям Liquid AI остановилась на упрощённом attention-only черновике с 4 слоями и размером блока 9; финальную смесь данных обучали 10 эпох, отслеживая долю принятых предсказаний. При инференсе рекомендуется размер блока 8 или 9 в зависимости от оборудования. Итоговый черновик добавляет около 280 млн параметров, это 8,9% сверх 3-миллиардной целевой модели.

Прирост скорости измерялся на шести разных задачах (общие визуальные вопросы-ответы, текстовые VQA, описание изображений, чтение графиков, сложные рассуждения, многоходовые диалоги) по методике бенчмарка MMSpec. На устройстве с MLX на чипе Apple M5 Max декодирование ускоряется в 2,30, 3,13 раза, а сквозная задержка сокращается в 1,56, 2,62 раза. На llama.cpp с чипом M3 Ultra декодирование ускоряется в 1,57, 2,14 раза, сквозная задержка, в 1,30, 1,77 раза. На GPU H100 декодирование ускоряется до 2,66 раза, а сквозная задержка, до 2,27 раза.

Liquid AI отмечает ограничение метода: спекулятивное декодирование ускоряет только этап генерации токенов, но не обработку изображения энкодером и не предзаполнение контекста (prefill). На edge-устройствах с ограниченными вычислительными ресурсами эти этапы занимают заметную долю общего времени, поэтому даже большое ускорение декодирования даёт более скромный прирост по всей цепочке, это иллюстрация закона Амдала, где общий выигрыш ограничен долей неускоренной части работы.

Модель поддерживается «с первого дня» в трёх фреймворках, llama.cpp, MLX-VLM и SGLang, через соответствующие сборки с патчами. Веса LFM2.5-VL-DSpark выложены на Hugging Face в форматах Safetensors и GGUF.

Ключевые факты

  • Liquid AI выпустила LFM2.5-VL-DSpark, модель-черновик для спекулятивного декодирования, ускоряющую визуально-языковую модель LFM2.5-VL-3B
  • Черновик добавляет около 280 млн параметров, 8,9% сверх 3-миллиардной целевой модели; архитектура, 4 слоя, размер блока 9, обучение 10 эпох
  • На устройстве (Apple M5 Max, MLX) декодирование ускоряется до 3,13 раза, сквозная задержка, до 2,62 раза; на M3 Ultra с llama.cpp, до 2,14 и 1,77 раза соответственно
  • На GPU H100 декодирование ускоряется до 2,66 раза, сквозная задержка, до 2,27 раза
  • Поддержка с первого дня в llama.cpp, MLX-VLM и SGLang; веса доступны на Hugging Face в форматах Safetensors и GGUF

Почему это важно

Спекулятивное декодирование, техника, при которой маленькая модель-черновик предлагает несколько токенов вперёд, а основная модель их проверяет, раньше применялась в основном к текстовым языковым моделям. Liquid AI перенесла её на визуально-языковые модели (VLM), где помимо текста нужно обрабатывать ещё и изображения, и показала заметное ускорение декодирования (до 3,13 раза на устройстве) без потери качества генерации, поскольку выход всегда сверяется целевой моделью.

Кому это важно

Разработчикам, которые разворачивают визуально-языковые модели на edge-устройствах, ноутбуках, телефонах, локальных серверах, где вычислительных ресурсов меньше, чем в дата-центре, и любое ускорение инференса напрямую снижает задержку и затраты. Также это важно инженерам, использующим фреймворки llama.cpp, MLX-VLM и SGLang для локального или GPU-инференса.

Как это применить

LFM2.5-VL-DSpark доступна на Hugging Face в форматах Safetensors и GGUF и подключается к целевой модели LFM2.5-VL-3B как драфт-модель. Поддержка реализована сразу в трёх инструментах: SGLang (флаг --speculative-algorithm DSPARK с указанием пути к драфт-модели), llama.cpp (параметр -md с GGUF-файлом черновика) и MLX-VLM (--draft-model). Рекомендуемый размер блока, 8 или 9 в зависимости от оборудования; итоговое качество генерации не меняется, поскольку алгоритм точный.

Можно ли доверять

Материал, официальный технический блог Liquid AI с описанием архитектуры, методики обучения и подробными цифрами по бенчмарку MMSpec на конкретном железе (Apple M5 Max, M3 Ultra, NVIDIA H100). Однако все замеры производительности, собственные, без независимой проверки и без сравнения с аналогичными техниками ускорения VLM у других компаний.

Риски и подводные камни

Прирост скорости ограничен законом Амдала: спекулятивное декодирование ускоряет только генерацию токенов, но не обработку изображения энкодером и не предзаполнение контекста, которые на edge-устройствах занимают значительную долю времени, поэтому реальный сквозной выигрыш заметно ниже максимального ускорения декодирования. Черновик также добавляет постоянный оверхед в 280 млн параметров (8,9% к размеру модели), а приведённые цифры ускорения привязаны к конкретному железу и могут не воспроизводиться на других конфигурациях.

«Спекулятивное декодирование точное: целевая модель проверяет каждый предложенный токен, поэтому результат жадной генерации совпадает с результатом одной лишь целевой модели»

— Liquid AI, блог компании