Liquid AI выпустила LFM2.5-2.6B: модель на 2,6 млрд параметров конкурирует с моделями вчетверо крупнее

Liquid AI опубликовала карточку модели LFM2.5-2.6B, часть семейства LFM2.5, предназначенного для развёртывания на устройстве (on-device). Модель построена на архитектуре LFM2, получила окно контекста 131 072 токена (128K) и прошла агентное дообучение (post-training). Компания заявляет, что по работе с инструментами (tool use), следованию инструкциям и многошаговым агентным задачам LFM2.5-2.6B конкурирует с моделями в четыре раза крупнее, конкретные названия этих моделей и результаты сравнительных тестов в источнике не приведены.

Формальные параметры модели: 2,69 млрд весов (в названии округлено до 2,6B), 30 слоёв, 22 блока с двойным гейтингом на коротких свёртках (double-gated short convolution) и 8 блоков GQA (group query attention). Модель предобучена на 34 трлн токенов, словарь токенизатора, 128 000 токенов, поддерживает 16 языков, включая русский. Дообучение состояло из четырёх этапов: два раунда контролируемой тонкой настройки (SFT), специализация по доменам через модели-учителя, мультидоменная дистилляция на собственных генерациях (on-policy distillation) и агентное обучение с подкреплением, на этом последнем этапе модель тренировали прямо внутри популярных агентных фреймворков (agentic harnesses), чтобы улучшить совместимость с их инструментами, системными промптами и паттернами взаимодействия.

По данным Liquid AI, это самая быстрая из протестированных ими моделей на CPU: 220 токенов в секунду на Apple M5 Max и 113 токенов в секунду на AMD Ryzen AI Max+ 395, при памяти менее 2,5 ГБ. Компания отмечает, что скорости в 30 токенов в секунду уже достаточно, чтобы запускать полноценных агентов даже на телефоне. На GPU модель также названа самой быстрой в своём классе размера: почти 15 000 выходных токенов в секунду при высокой конкурентности и примерно 1,3 млрд токенов в сутки на одной видеокарте H100, уровень конкурентности, размер батча и точность вычислений для этих цифр не указаны.

Liquid AI рекомендует модель для агентных задач, работы с инструментами, извлечения данных, RAG и работы с длинным контекстом, но прямо не рекомендует её для агентного кодинга и задач, требующих больших фоновых знаний. LFM2.5 поддерживает вызов функций (function calling): по умолчанию модель формирует питонический (Pythonic) вызов функции, но может быть переключена на формат JSON через системный промпт. Модель доступна для запуска через Transformers, vLLM, SGLang и Docker Model Runner. За последний месяц карточку модели на Hugging Face скачали 89 680 раз.

Ключевые факты

  • LFM2.5-2.6B: 2,69 млрд параметров (округлено до 2,6B в названии), окно контекста 131 072 токена, модель для развёртывания на устройстве
  • Liquid AI заявляет, что по работе с инструментами, следованию инструкциям и агентным задачам модель конкурирует с моделями в 4 раза крупнее, конкретные модели и цифры сравнения не названы
  • На CPU: 220 токен/с на Apple M5 Max и 113 токен/с на AMD Ryzen AI Max+ 395 при памяти до 2,5 ГБ; на GPU, почти 15 000 токен/с при высокой конкурентности, около 1,3 млрд токенов в сутки на одном H100
  • Рекомендована для агентных задач, работы с инструментами, извлечения данных, RAG и длинного контекста; не рекомендована для агентного кодинга и задач с большими фоновыми знаниями
  • За последний месяц модель скачали на Hugging Face 89 680 раз

Почему это важно

LFM2.5-2.6B, пример тренда на компактные модели, которые по заявлению разработчиков приближаются по возможностям к моделям в разы крупнее, но при этом работают на слабом железе, телефоне, ноутбуке, edge-устройстве без GPU. Если заявленная конкурентоспособность с моделями вчетверо больше подтвердится независимо, это снижает стоимость и порог входа для агентных сценариев, которые раньше требовали облачных LLM.

Кому это важно

Разработчикам, которые строят агентов и инструменты с вызовом функций для мобильных и edge-устройств; компаниям, которым нужен локальный инференс без затрат на GPU-облако; тем, кто работает с длинным контекстом (RAG, извлечение данных) и хочет модель, которую можно запускать офлайн.

Как это применить

Модель доступна на Hugging Face и запускается через Transformers, vLLM, SGLang или Docker Model Runner, включая готовые Docker-образы. Поддерживается вызов функций в питоническом формате (по умолчанию) или в JSON, по выбору через системный промпт. Liquid AI прямо рекомендует модель для агентных задач, работы с инструментами, извлечения данных, RAG и длинного контекста, но не рекомендует её для агентного кодинга и задач, требующих больших фоновых знаний. Для конкретного применения компания советует дополнительно дообучить модель под свою задачу (fine-tuning).

Можно ли доверять

Все цифры и заявления в этом пересказе, из собственной карточки модели Liquid AI, то есть это заявления разработчика, а не независимая проверка. Ключевое утверждение о конкурентоспособности с моделями в 4 раза крупнее не подкреплено ни названиями этих моделей, ни конкретными результатами тестов, источник лишь упоминает, что сравнение проводилось на «разнообразном наборе бенчмарков» без публикации самих цифр. Цифры скорости на GPU (почти 15 000 токен/с, ~1,3 млрд токенов в сутки) даны без указания уровня конкурентности, размера батча и точности вычислений, что мешает независимо проверить сравнение.

Риски и подводные камни

Модель прямо не рекомендована для агентного кодинга и задач, требующих больших фоновых знаний, заявленная универсальность агента ограничена. В источнике нет информации о лицензии и цене использования. Компания не раскрывает, с какими именно моделями сравнивала LFM2.5-2.6B и какие результаты получила, поэтому заявление о конкуренции с моделями вчетверо крупнее нельзя проверить самостоятельно.