Liquid AI выпустила LFM2.5-Encoders, CPU-энкодеры в 3,7 раза быстрее ModernBERT

Liquid AI выпустила LFM2.5-Encoders, CPU-энкодеры в 3,7 раза быстрее ModernBERT

Liquid AI выпустила семейство LFM2.5-Encoders, две открытые модели-энкодера, LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. Их получили из causal-декодеров LFM2.5-230M и LFM2.5-350M, превратив декодер в двунаправленный энкодер: добавили двунаправленную маску внимания, сделали короткие свёртки не-каузальными с симметричным паддингом (каждый токен теперь учитывает соседей с обеих сторон) и обучили маскированному языковому моделированию с маскировкой 30% токенов. Обучение шло в два этапа: сначала общая языковая компетенция на коротком контексте (1024 токена) на большом веб-корпусе, затем адаптация к длинному контексту, расширение до 8192 токенов на полном датасете с усилением фактологических, юридических и мультиязычных данных. Это второй релиз в линейке LFM2.5 после LFM2.5-Retrievers (вышли месяцем ранее и заточены узко под мультиязычный поиск), новые энкодеры общего назначения, пригодные для классификации, разметки токенов и поиска сразу.

В бенчмарке из 17 задач (GLUE, SuperGLUE и мультиязычная классификация) каждая из 14 сравниваемых моделей дообучалась полностью под каждую задачу, результат усреднён по 5 отложенным seed-ам для стабильности. LFM2.5-Encoder-350M занял 4-е место из 14: три модели впереди него крупнее, включая одну на 3,5 млрд параметров, почти в 10 раз больше. LFM2.5-Encoder-230M обошёл ModernBERT-base и все протестированные модели EuroBERT, при этом уступая большинству из них в размере. Обе новые модели показали результат выше собственных прежних LFM2.5-Retrievers Liquid AI на этом бенчмарке.

Главное преимущество, скорость на CPU. При равном для обеих архитектур контексте в 8192 токена LFM2.5-Encoder-230M оказался самым быстрым на любой длине входа, обгоняя даже более мелкий ModernBERT-base на коротких текстах. На полном контексте в 8192 токена forward pass у ModernBERT-base занимает больше полутора минут, у LFM2.5-Encoder-230M, около 28 секунд: это и есть заявленное ускорение в 3,7 раза. На GPU (тест на Apple GPU) картина скромнее: ниже примерно 1000 токенов лидирует ModernBERT-base, LFM2.5-Encoders вырываются вперёд начиная примерно с 2000 токенов.

Назначение моделей, компоненты production-конвейеров, которые работают постоянно и должны оставаться дешёвыми: роутеры интентов, фильтры по правилам, детекторы персональных данных, текстовые классификаторы. Liquid AI выложила пять демо на CPU-only Hugging Face Spaces: zero-shot-роутинг запросов по произвольно заданным правилам, zero-shot-проверка текста на соответствие правилам компании, исправление опечаток, детекция 40 типов персональных данных (PII) на 16 языках и генерация текста через маскированную диффузию (модель работает как чат-бот, поэтапно снимая маску вместо генерации слева направо).

Обе модели открыты и доступны на Hugging Face. Устанавливаются через pip install -U transformers; запустить предсказание замаскированного токена можно через AutoModelForMaskedLM и AutoTokenizer, а для дообучения под конкретную задачу, загрузить тело модели через AutoModel и присоединить свою "голову" (классификация, разметка токенов, регрессия, поиск). На GPU поддерживается Flash Attention 2. Liquid AI рекомендует брать LFM2.5-Encoder-350M, когда важнее точность, и LFM2.5-Encoder-230M, при более слабом железе или когда нужна высокая пропускная способность.

Ключевые факты

  • Liquid AI выпустила LFM2.5-Encoder-230M и LFM2.5-Encoder-350M, открытые модели-энкодеры на архитектуре LFM2.5 с контекстом до 8192 токенов
  • На CPU LFM2.5-Encoder-230M обрабатывает вход в 8192 токена примерно за 28 секунд против больше полутора минут у ModernBERT-base, ускорение в 3,7 раза
  • В бенчмарке из 17 задач GLUE, SuperGLUE и мультиязычной классификации (14 моделей) LFM2.5-Encoder-350M занял 4-е место, уступив только более крупным моделям, включая 3,5-миллиардную; LFM2.5-Encoder-230M обошёл ModernBERT-base и все модели EuroBERT
  • Модели нацелены на роутинг интентов, проверку текста по правилам (policy linting) и детекцию персональных данных (40 типов на 16 языках); на Hugging Face Spaces выложены пять CPU-only демо
  • Веса открыты на Hugging Face, загрузка через библиотеку transformers; Liquid AI советует 350M-версию ради точности и 230M, для слабого железа или высокой пропускной способности

Почему это важно

Encoder-модели BERT-класса остаются рабочей лошадкой production NLP: классификаторы, роутеры интентов и фильтры безопасности работают постоянно, обычно на CPU, и их стоимость должна расти медленно с увеличением длины входа. LFM2.5-Encoders продолжают эту линию развития (BERT → ModernBERT → LFM2.5-Encoders), перенося архитектуру LFM2 на энкодеры: контекст вырос до 8192 токенов, а задержка с ростом входа увеличивается медленнее, чем у предшественников.

Кому это важно

Разработчикам и командам, которые строят классификаторы, роутеры интентов, фильтры контента и детекторы персональных данных для production-конвейеров, особенно на инфраструктуре без GPU. Также релевантно тем, кто уже использует ModernBERT или EuroBERT и ищет более быстрый вариант при сопоставимом или лучшем качестве.

Как это применить

Обе модели в открытом доступе на Hugging Face (LFM2.5-Encoder-230M и LFM2.5-Encoder-350M). Устанавливаются через pip install -U transformers; для предсказания замаскированного токена используется AutoModelForMaskedLM с AutoTokenizer, для дообучения под свою задачу, тело модели через AutoModel с присоединённой собственной "головой" (классификация, разметка токенов, регрессия, поиск). На GPU поддерживается Flash Attention 2, есть туториал по дообучению на длинных юридических документах с контекстом 8k. Между размерами: 350M, когда важнее точность, 230M, для более слабого железа или большей пропускной способности.

Можно ли доверять

Все цифры и графики, из собственного блога Liquid AI, независимого стороннего аудита в источнике нет. При этом методика описана подробно: 17 задач из GLUE, SuperGLUE и мультиязычной классификации, результат усреднён по 5 отложенным seed-ам для стабильности, а фреймворк и сырые результаты выложены в открытый доступ для проверки. У компании уже есть предыдущий релиз в этой линейке, LFM2.5-Retrievers, вышедший месяцем ранее.

Риски и подводные камни

Преимущество по скорости на GPU заметно скромнее, чем на CPU: на тестовом Apple GPU ModernBERT-base лидирует ниже примерно 1000 токенов, LFM2.5-Encoders вырываются вперёд только начиная примерно с 2000 токенов. Базовая модель даёт лишь общие представления и не готова к работе "из коробки", под каждую задачу требуется отдельное дообучение. Опубликованные демо (роутинг запросов, детектор PII и другие), витрина возможностей, а не готовые production-системы.

«Для разработчиков это означает, что можно просканировать или классифицировать целый договор, стенограмму или длинную переписку поддержки меньше чем за 30 секунд на CPU обычного ноутбука.»

— из блога Liquid AI