Liquid AI выпустила LFM2.5-2.6B, компактную модель для ИИ-агентов на устройстве

Liquid AI выпустила LFM2.5-2.6B и её базовую версию LFM2.5-2.6B-Base, компактную агентную модель, рассчитанную на локальный запуск на устройствах. В блоге компания подробно описала конвейер обучения модели и результаты бенчмарков против моделей примерно в 4 раза крупнее.
Модель предобучена на ~34 трлн токенов, после чего на этапе mid-training окно контекста расширили до 128K. Дальше идёт четырёхэтапный post-training: два раунда SFT (supervised fine-tuning) с упором на агентные данные, работу с инструментами, веб-поиск, траектории в агентных harness'ах; затем обучение отдельного «учителя»-специалиста под каждый домен (математика, код, работа с инструментами и другие); затем дистилляция всех учителей в одного «ученика» (MOPD, multi-domain on-policy distillation); и наконец агентное обучение с подкреплением (Agentic RL), многоходовое RL прямо внутри реальных агентных harness'ов, где модель учится работать с разными инструментами, системными промптами и многошаговыми задачами. Пайплайн Agentic RL разделён на компоненты: Training Engine оптимизирует модель, Rollout Engine генерирует действия по текущей политике, RL-фреймворк управляет циклом обучения, запускает роллауты, собирает траектории и награды и обновляет модель. Действия выполняются в Sandbox Service, где Blackbox Harness хостит агента (например, OpenClaw или Hermes Agent), а Harness Proxy позволяет использовать любой harness как чёрный ящик, при этом прозрачно фиксируя траектории на уровне токенов для обучения.
На бенчмарках по STEM, следованию инструкциям, работе с инструментами и агентным задачам LFM2.5-2.6B сравнивали с моделями до ~4 раз крупнее. Liquid AI утверждает, что при этом их модель, самая маленькая в группе, но конкурирует с остальными и часто их превосходит: она лидирует на всех тестах следования инструкциям и на всех тестах работы с инструментами, кроме BFCLv4, где чуть впереди 9,7-миллиардная модель Qwen. На агентных задачах LFM2.5-2.6B обходит обе модели Gemma и держится вровень с моделями Qwen, лидирует по знаниям и близка по математике. Единственная область, где крупные модели сохраняют явное преимущество, кодинг.
Модель с первого дня поддерживается основной инференс-экосистемой: llama.cpp, MLX, vLLM, SGLang, ONNX. На CPU это, по заявлению компании, самая быстрая из протестированных моделей: 220 токенов/с на Apple M5 Max и 113 токенов/с на AMD Ryzen AI Max+ 395, при этом память укладывается менее чем в 2,5 ГБ; скорости в 30 токенов/с, по словам Liquid AI, уже достаточно для работы полноценных агентов на телефоне. На GPU модель названа самой быстрой в своём классе размера, почти 15 тысяч выходных токенов в секунду при высокой конкурентности, то есть примерно 1,3 млрд токенов в сутки на одном H100.
LFM2.5-2.6B и LFM2.5-2.6B-Base уже доступны на Hugging Face. Компания также открыла браузерную демонстрацию на WebGPU без установки, исследовательского агента, который отвечает на вопросы и готовит резюме, и опубликовала руководство по запуску модели в агентных harness'ах вроде OpenClaw, Hermes Agent и Pi.
Ключевые факты
- Liquid AI выпустила LFM2.5-2.6B и базовую версию LFM2.5-2.6B-Base, агентную модель для локального запуска на устройствах, уже доступны на Hugging Face
- Предобучена на ~34 трлн токенов, окно контекста расширено до 128K; post-training, 4 этапа: SFT, специализация «учителей» по доменам, дистилляция MOPD, агентное RL внутри реальных harness'ов (например, OpenClaw)
- На бенчмарках против моделей до ~4 раз крупнее лидирует по следованию инструкциям и почти везде по работе с инструментами (уступает только 9,7-миллиардному Qwen на BFCLv4); в кодинге крупные модели всё ещё впереди
- На CPU, 220 токенов/с на Apple M5 Max и 113 токенов/с на AMD Ryzen AI Max+ 395 при памяти менее 2,5 ГБ; на GPU, почти 15 тысяч токенов/с при высокой конкурентности, около 1,3 млрд токенов в сутки на одном H100
- Поддержка llama.cpp, MLX, vLLM, SGLang и ONNX с первого дня; есть браузерная WebGPU-демо без установки
Почему это важно
Компактная модель, которая на бенчмарках следования инструкциям и работы с инструментами держится вровень или обходит модели вчетверо крупнее, снижает стоимость и задержку локальных ИИ-агентов и снимает зависимость от облачного инференса. Это шаг в сторону агентов, которые полноценно работают прямо на устройстве пользователя, от ноутбука до телефона.
Кому это важно
Разработчикам, которые строят локальных или edge-агентов, офлайн-инструменты и мобильные приложения с ИИ, где важны низкая задержка, приватность данных и отсутствие постоянного доступа к облаку. Полезно и командам, которым нужен дешёвый высокообъёмный инференс на собственном железе, включая GPU вроде H100.
Как это применить
Модель ставится через pip install -U transformers (нужна версия 5.0.0+) и запускается стандартным AutoModelForCausalLM.from_pretrained("LiquidAI/LFM2.5-2.6B"). Есть браузерная демонстрация на WebGPU без установки и руководство по подключению модели к агентным harness'ам, OpenClaw, Hermes Agent, Pi. Обе версии, LFM2.5-2.6B и LFM2.5-2.6B-Base, уже доступны на Hugging Face.
Можно ли доверять
Источник, официальный блог Liquid AI, компании-разработчика модели, то есть это первичный, но не независимый источник. Все сравнения с конкурентами (Gemma, Qwen) даны только в качественной форме, «лидирует», «обходит», «держится вровень», «чуть впереди», без точных числовых значений бенчмарков, поэтому проверить масштаб превосходства по самому посту нельзя.
Риски и подводные камни
Цена и условия лицензирования модели в материале не указаны. В кодинге, по признанию самой компании, крупные модели всё ещё превосходят LFM2.5-2.6B. Заявления о скорости и качестве, собственные тесты Liquid AI без независимой перепроверки и без публикации точных цифр бенчмарков, так что реальные результаты в конкретном сценарии использования могут отличаться.