NeoMME: энкодер для поиска по документам вдвое быстрее ColModernVBERT

Мультимодальные модели обычно строят на архитектурах для генеративного связывания текста и изображений: заранее обученный визуальный энкодер соединяют с большой языковой моделью. Визуальные ретриверы документов вроде ColPali переиспользуют такие модели как энкодеры, унаследуя от них весь объём параметров и вычислений, рассчитанный на генеративную задачу, хотя сама задача поиска, не генеративная.
Авторы предлагают NeoMME, семейство двунаправленных энкодеров на 260 и 800 миллионов параметров, которые обрабатывают многоязычный текст и сырые патчи изображений в одном общем трансформере, без отдельных блоков под текст и под картинку. Обе модели обучены с нуля на задаче маскированной дискретной диффузии текста, а при работе с мультимодальными примерами эта задача дополнительно опирается на видимые патчи изображения. Обе версии поддерживают контекст в 16 384 токена, этого хватает, чтобы закодировать до двух стандартных изображений в разрешении 4K UHD.
Чтобы показать возможности модели на практике, авторы дообучили NeoMME с совместно обученными «плотной» (dense) и «поздней» (late-interaction) поисковыми головами. На бенчмарке ViDoRe v3 версия NeoMME-Retriever на 260 миллионов параметров обходит все протестированные модели строго ниже 800 миллионов параметров, набирая 0.523 по метрике nDCG@10, а версия на 800 миллионов параметров достигает 0.556. При одинаковом размере входного изображения 2048×2048 на видеокарте NVIDIA L40S модель NeoMME-260M обрабатывает страницы документов с примерно вдвое большей пропускной способностью, чем ColModernVBERT. Отдельно авторы применили иерархическое сжатие токенов (token pooling) и асимметричное квантование, которые сжимают эмбеддинги документов, полученные по схеме поздней интеракции, в 255 раз, при этом сохраняется более 95% исходного значения nDCG@10.
NeoMME передан в библиотеку Hugging Face Transformers, а предобученная базовая модель и совместимые с поиском по документам контрольные точки выложены в открытый доступ под лицензией Apache 2.0.
Ключевые факты
- NeoMME, семейство из двух двунаправленных мультимодальных и мультиязычных энкодеров: 260 и 800 миллионов параметров, единая архитектура для текста и изображений вместо связки «визуальный энкодер + языковая модель»
- Обучены с нуля на задаче маскированной дискретной диффузии текста; поддерживают контекст 16 384 токена, до двух изображений в разрешении 4K UHD
- На бенчмарке ViDoRe v3 версия на 260 млн параметров набирает 0.523 nDCG@10 (лучший результат среди моделей строго до 800 млн параметров), версия на 800 млн, 0.556
- При одинаковом размере изображения 2048×2048 на GPU NVIDIA L40S модель NeoMME-260M кодирует страницы примерно вдвое быстрее, чем ColModernVBERT
- Сжатие эмбеддингов (иерархический пулинг токенов + асимметричное квантование) уменьшает их размер в 255 раз при сохранении свыше 95% исходного качества; модель и веса выложены под лицензией Apache 2.0 в Hugging Face Transformers
Почему это важно
Поиск по документам с картинками (сканы, PDF, слайды) сегодня чаще всего строят поверх визуально-языковых моделей вроде ColPali, то есть под задачу поиска и ранжирования тратят вычислительные мощности, рассчитанные на генерацию текста. NeoMME убирает эту избыточность: одна двунаправленная модель сразу обучена на совместную обработку текста и изображений и не тащит за собой генеративную часть. За счёт этого модель на 260 миллионов параметров обходит по качеству все более крупные (но всё ещё компактные) альтернативы на бенчмарке ViDoRe v3 и кодирует страницы вдвое быстрее ColModernVBERT при равных условиях.
Кому это важно
В первую очередь, командам, которые строят поиск и ретрив по корпоративным документам, PDF-архивам, сканам и презентациям: там, где нужно быстро находить релевантные страницы по изображению, а не только по извлечённому тексту. Также модель интересна инженерам, которые упираются в стоимость инференса визуальных ретриверов на больших объёмах документов, компактный размер (260, 800 миллионов параметров) и двукратный прирост скорости снижают нагрузку на GPU.
Как это применить
NeoMME уже передан в библиотеку Hugging Face Transformers, а предобученная базовая модель и контрольные точки, готовые для поиска, выложены в открытый доступ под лицензией Apache 2.0, это разрешает свободное использование и модификацию, включая коммерческое применение. Дополнительно авторы показали, что эмбеддинги, полученные по схеме поздней интеракции, можно сжать в 255 раз с помощью иерархического пулинга токенов и асимметричного квантования, почти не потеряв в качестве (более 95% исходного nDCG@10), это отдельно снижает требования к хранению векторов при промышленном внедрении.
Можно ли доверять
Цифры (0.523 и 0.556 nDCG@10 на ViDoRe v3, двукратный прирост пропускной способности, 255-кратное сжатие с сохранением свыше 95% качества) взяты из текста самой публикации на странице Hugging Face Papers; независимого стороннего тестирования или воспроизведения результатов в источнике не приводится. Имена авторов и организация-разработчик в тексте статьи не указаны, поэтому здесь они не называются. Материал стоит воспринимать как самоотчёт авторов о собственной модели, типичный для препринтов формат, но требующий проверки независимыми бенчмарками при принятии решения о внедрении.
Риски и подводные камни
В источнике не раскрыты состав и объём обучающих данных, а также вычислительный бюджет, потраченный на предобучение, это затрудняет оценку того, насколько результаты воспроизводимы и насколько они специфичны для конкретного тестового набора ViDoRe v3. Абсолютных цифр пропускной способности (страниц в секунду) не приведено, только относительный показатель «примерно вдвое», что осложняет прямое сравнение с другими системами вне названных ColPali и ColModernVBERT. Сроки выпуска контрольных точек за пределами самого факта публикации в тексте также не указаны.