Liquid AI выпустила LFM2.5-Encoders, CPU-энкодеры в 3,7 раза быстрее ModernBERT

Liquid AI выпустила семейство LFM2.5-Encoders, две открытые модели-энкодера, LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. Их получили из causal-декодеров LFM2.5-230M и LFM2.5-350M, превратив декодер в двунаправленный энкодер: добавили двунаправленную маску внимания, сделали короткие свёртки не-каузальными с симметричным паддингом (каждый токен теперь учитывает соседей с обеих сторон) и обучили маскированному языковому моделированию с маскировкой 30% токенов. Обучение шло в два этапа: сначала общая языковая компетенция на коротком контексте (1024 токена) на большом веб-корпусе, затем адаптация к длинному контексту, расширение до 8192 токенов на полном датасете с усилением фактологических, юридических и мультиязычных данных. Это второй релиз в линейке LFM2.5 после LFM2.5-Retrievers (вышли месяцем ранее и заточены узко под мультиязычный поиск), новые энкодеры общего назначения, пригодные для классификации, разметки токенов и поиска сразу.
В бенчмарке из 17 задач (GLUE, SuperGLUE и мультиязычная классификация) каждая из 14 сравниваемых моделей дообучалась полностью под каждую задачу, результат усреднён по 5 отложенным seed-ам для стабильности. LFM2.5-Encoder-350M занял 4-е место из 14: три модели впереди него крупнее, включая одну на 3,5 млрд параметров, почти в 10 раз больше. LFM2.5-Encoder-230M обошёл ModernBERT-base и все протестированные модели EuroBERT, при этом уступая большинству из них в размере. Обе новые модели показали результат выше собственных прежних LFM2.5-Retrievers Liquid AI на этом бенчмарке.
Главное преимущество, скорость на CPU. При равном для обеих архитектур контексте в 8192 токена LFM2.5-Encoder-230M оказался самым быстрым на любой длине входа, обгоняя даже более мелкий ModernBERT-base на коротких текстах. На полном контексте в 8192 токена forward pass у ModernBERT-base занимает больше полутора минут, у LFM2.5-Encoder-230M, около 28 секунд: это и есть заявленное ускорение в 3,7 раза. На GPU (тест на Apple GPU) картина скромнее: ниже примерно 1000 токенов лидирует ModernBERT-base, LFM2.5-Encoders вырываются вперёд начиная примерно с 2000 токенов.
Назначение моделей, компоненты production-конвейеров, которые работают постоянно и должны оставаться дешёвыми: роутеры интентов, фильтры по правилам, детекторы персональных данных, текстовые классификаторы. Liquid AI выложила пять демо на CPU-only Hugging Face Spaces: zero-shot-роутинг запросов по произвольно заданным правилам, zero-shot-проверка текста на соответствие правилам компании, исправление опечаток, детекция 40 типов персональных данных (PII) на 16 языках и генерация текста через маскированную диффузию (модель работает как чат-бот, поэтапно снимая маску вместо генерации слева направо).
Обе модели открыты и доступны на Hugging Face. Устанавливаются через pip install -U transformers; запустить предсказание замаскированного токена можно через AutoModelForMaskedLM и AutoTokenizer, а для дообучения под конкретную задачу, загрузить тело модели через AutoModel и присоединить свою "голову" (классификация, разметка токенов, регрессия, поиск). На GPU поддерживается Flash Attention 2. Liquid AI рекомендует брать LFM2.5-Encoder-350M, когда важнее точность, и LFM2.5-Encoder-230M, при более слабом железе или когда нужна высокая пропускная способность.
Ключевые факты
- Liquid AI выпустила LFM2.5-Encoder-230M и LFM2.5-Encoder-350M, открытые модели-энкодеры на архитектуре LFM2.5 с контекстом до 8192 токенов
- На CPU LFM2.5-Encoder-230M обрабатывает вход в 8192 токена примерно за 28 секунд против больше полутора минут у ModernBERT-base, ускорение в 3,7 раза
- В бенчмарке из 17 задач GLUE, SuperGLUE и мультиязычной классификации (14 моделей) LFM2.5-Encoder-350M занял 4-е место, уступив только более крупным моделям, включая 3,5-миллиардную; LFM2.5-Encoder-230M обошёл ModernBERT-base и все модели EuroBERT
- Модели нацелены на роутинг интентов, проверку текста по правилам (policy linting) и детекцию персональных данных (40 типов на 16 языках); на Hugging Face Spaces выложены пять CPU-only демо
- Веса открыты на Hugging Face, загрузка через библиотеку transformers; Liquid AI советует 350M-версию ради точности и 230M, для слабого железа или высокой пропускной способности
Почему это важно
Encoder-модели BERT-класса остаются рабочей лошадкой production NLP: классификаторы, роутеры интентов и фильтры безопасности работают постоянно, обычно на CPU, и их стоимость должна расти медленно с увеличением длины входа. LFM2.5-Encoders продолжают эту линию развития (BERT → ModernBERT → LFM2.5-Encoders), перенося архитектуру LFM2 на энкодеры: контекст вырос до 8192 токенов, а задержка с ростом входа увеличивается медленнее, чем у предшественников.
Кому это важно
Разработчикам и командам, которые строят классификаторы, роутеры интентов, фильтры контента и детекторы персональных данных для production-конвейеров, особенно на инфраструктуре без GPU. Также релевантно тем, кто уже использует ModernBERT или EuroBERT и ищет более быстрый вариант при сопоставимом или лучшем качестве.
Как это применить
Обе модели в открытом доступе на Hugging Face (LFM2.5-Encoder-230M и LFM2.5-Encoder-350M). Устанавливаются через pip install -U transformers; для предсказания замаскированного токена используется AutoModelForMaskedLM с AutoTokenizer, для дообучения под свою задачу, тело модели через AutoModel с присоединённой собственной "головой" (классификация, разметка токенов, регрессия, поиск). На GPU поддерживается Flash Attention 2, есть туториал по дообучению на длинных юридических документах с контекстом 8k. Между размерами: 350M, когда важнее точность, 230M, для более слабого железа или большей пропускной способности.
Можно ли доверять
Все цифры и графики, из собственного блога Liquid AI, независимого стороннего аудита в источнике нет. При этом методика описана подробно: 17 задач из GLUE, SuperGLUE и мультиязычной классификации, результат усреднён по 5 отложенным seed-ам для стабильности, а фреймворк и сырые результаты выложены в открытый доступ для проверки. У компании уже есть предыдущий релиз в этой линейке, LFM2.5-Retrievers, вышедший месяцем ранее.
Риски и подводные камни
Преимущество по скорости на GPU заметно скромнее, чем на CPU: на тестовом Apple GPU ModernBERT-base лидирует ниже примерно 1000 токенов, LFM2.5-Encoders вырываются вперёд только начиная примерно с 2000 токенов. Базовая модель даёт лишь общие представления и не готова к работе "из коробки", под каждую задачу требуется отдельное дообучение. Опубликованные демо (роутинг запросов, детектор PII и другие), витрина возможностей, а не готовые production-системы.
«Для разработчиков это означает, что можно просканировать или классифицировать целый договор, стенограмму или длинную переписку поддержки меньше чем за 30 секунд на CPU обычного ноутбука.»
— из блога Liquid AI