Liquid AI выпустила LFM2.5-VL-3B, модель для распознавания экранов и объектов

Liquid AI выпустила LFM2.5-VL-3B, новую версию своей мультимодальной модели, которая понимает и изображения, и текст. По сравнению с прежними релизами компания выделяет четыре улучшения: более уверенное распознавание экранов и интерфейсов на разных устройствах, более точный поиск объектов по текстовому описанию (grounding), улучшенное рассуждение по нескольким изображениям сразу и заметно более сильный вызов функций, как в чисто текстовом режиме, так и при работе с изображениями.
Модель сочетает визуальный энкодер SigLIP2 на 400 млн параметров (вариант NaFlex) с тем же ядром, что используется в текстовой модели LFM2.5-2.6B. Предобучение прошло на примерно 34 трлн токенов, при этом визуальных данных для обучения было в 4 раза больше, чем в предыдущем релизе, из подобранных и синтетических наборов подписей к изображениям, распознавания текста на изображениях (OCR), поиска объектов и следования инструкциям. Чтобы лучше работать с нелатинскими алфавитами, словарь токенизатора расширили вдвое, до 128 тысяч токенов, продолжив имеющийся токенизатор, а не обучая новый с нуля. После предобучения модель прошла через обучение с учителем (включая дистилляцию знаний от более крупной модели-учителя и отдельный этап под названием Antidoom), а затем через обучение с подкреплением на нескольких видах вознаграждения.
По словам Liquid AI, LFM2.5-VL-3B лидирует в своём классе по размеру на задачах с реальными изображениями и при этом хорошо читает цифровой контент, документы, графики и элементы интерфейса на экране. В текстовых задачах на вызов функций модель, по заявлению компании, сопоставима с Gemma-4-E2B и Qwen3.5-2B; отдельно отмечается, что модели линейки InternVL 3.5 вообще не поддерживают вызов функций. Точные числовые баллы из таблицы сравнения в доступном тексте статьи не приводятся, указана только методология замеров.
По скорости на устройстве модель выдаёт 228 токенов в секунду на Apple M5 Max, 116 токенов в секунду на Ryzen AI Max+ 395 и около 20 токенов в секунду на смартфоне Galaxy S26 Ultra, при этом требует всего около 3 ГБ памяти. На GPU модель, по заявлению Liquid AI, держит стабильно низкую задержку и работает быстрее конкурентов при обработке нескольких кадров сразу. По пропускной способности вывода на выходе она достигает около 11 тысяч токенов в секунду при высокой параллельной нагрузке, это примерно вдвое быстрее моделей класса 4B и, по подсчётам компании, соответствует почти 1 млрд выходных токенов в сутки на одном GPU H100.
Модель уже доступна на Hugging Face (LiquidAI/LFM2.5-VL-3B) и с первого дня поддерживается основными инструментами инференса, llama.cpp, MLX, vLLM, SGLang и ONNX. Liquid AI приводит пример запуска через библиотеку transformers версии не ниже 5.10.1, предлагает браузерную демонстрацию на WebGPU без установки и туториалы по дообучению модели под свои задачи.
Ключевые факты
- Liquid AI выпустила LFM2.5-VL-3B, мультимодальную модель на 3 млрд параметров с визуальным энкодером SigLIP2 (400 млн параметров) поверх текстового ядра LFM2.5-2.6B
- Предобучена на ~34 трлн токенов, визуальных данных при обучении стало в 4 раза больше, чем в прошлом релизе; словарь токенизатора расширен до 128 тысяч токенов для нелатинских алфавитов
- Заявленные улучшения: понимание экранов и интерфейсов, точный поиск объектов по описанию, рассуждение по нескольким изображениям, более сильный вызов функций
- На устройстве работает при ~3 ГБ памяти: 228 токенов/с на Apple M5 Max, 116 токенов/с на Ryzen AI Max+ 395, 20 токенов/с на Galaxy S26 Ultra; на GPU H100, около 11 тыс. токенов/с на выходе, вдвое быстрее моделей класса 4B
- Модель доступна на Hugging Face с первого дня поддерживается llama.cpp, MLX, vLLM, SGLang и ONNX, есть браузерная демонстрация на WebGPU и туториалы по дообучению
Почему это важно
Это очередной шаг Liquid AI в сторону компактных мультимодальных моделей, которые можно запускать прямо на устройстве, а не через облако. Компания прямо называет четыре улучшения относительно прежних релизов линейки: понимание экранов и интерфейсов, точный поиск объектов по текстовому описанию, рассуждение сразу по нескольким изображениям и заметно более сильный вызов функций. Такое сочетание, распознавание интерфейса плюс вызов функций, нужно в первую очередь для агентов, которые должны сами ориентироваться на экране устройства и совершать в нём действия.
Кому это важно
В первую очередь, разработчикам мобильных и edge-приложений с искусственным интеллектом, где важны низкая задержка, малый расход памяти и работа без постоянного подключения к облаку. Также модель может заинтересовать команды, которые строят ИИ-агентов для автоматизации действий на экране (screen understanding), и тех, кому нужна дешёвая высокая пропускная способность инференса при массовой обработке запросов на GPU.
Как это применить
Модель уже выложена на Hugging Face под именем LiquidAI/LFM2.5-VL-3B. Для запуска нужна библиотека transformers версии не ниже 5.10.1; Liquid AI приводит готовый пример кода для загрузки модели и описания изображения. С первого дня доступна поддержка в llama.cpp, MLX, vLLM, SGLang и ONNX, есть браузерная демонстрация на WebGPU без установки и туториалы по дообучению модели под свою задачу. Условия использования, цена и лицензия в тексте не раскрываются.
Можно ли доверять
Источник, официальный блог Liquid AI, то есть все цифры и сравнения (лидерство в классе, паритет с Gemma-4-E2B и Qwen3.5-2B по вызову функций, превосходство по скорости), это заявления самой компании, без независимой проверки. Числовые баллы из таблицы сравнения в доступном тексте статьи отсутствуют, приведена только методология измерений (vLLM 0.26.0, рекомендованные параметры генерации, режим без рассуждений), сами цифры проверить по этому тексту нельзя.
Риски и подводные камни
Все заявленные преимущества, самоотчёт разработчика без независимого бенчмарка со стороны. Отдельный этап обучения под названием Antidoom упомянут без объяснения, что именно он делает. Информации о цене и условиях лицензирования модели в источнике нет, использовать в коммерческих продуктах стоит только после проверки лицензии на странице модели.