Pixel Linguist II показал рекордную точность чтения текста по пикселям

Существующие модели, которые обрабатывают текст не как последовательность токенов, а напрямую как картинку («пиксельные» текстовые кодировщики), плохо справляются с несколькими типичными проблемами: обучаются на изображениях фиксированного разрешения и потом не переносятся на документы высокого разрешения, «жульничают», цепляются за поверхностные визуальные подсказки вместо того чтобы по-настоящему прочитать и понять текст (так называемое shortcut learning, обучение по обходным путям), слабо связывают распознанный текст с самим изображением (visual grounding, визуальная привязка) и плохо понимают текст на разных языках. Авторы работы провели серию контролируемых абляций, экспериментов, в которых по очереди убирали или меняли отдельные компоненты обучения, чтобы понять, что реально влияет на качество, и выделили четыре принципа, необходимых для устойчивого понимания текста по пикселям: переменное разрешение изображений и переменный размер отрисованного шрифта во время обучения (они заменяют реальные документы высокого разрешения и позволяют модели обобщаться на них); обязательное обучение на естественных парах «изображение-текст» (без них модель скатывается в чисто текстовое поведение и теряет привязку к изображению); отрисовка текста с сохранением реальной вёрстки (layout-aware rendering), которая не даёт модели искать лёгкие визуальные подсказки вместо содержания; и двухэтапный многоязычный учебный план (curriculum), который обеспечивает выравнивание между языками. На основе этих принципов авторы обучили Pixel Linguist II, кодировщик изображений, работающий с исходным (native) разрешением, с отрисовкой текста «на лету», унифицированной контрастной привязкой и многоязычным учебным планом, на 280 миллионах обучающих примеров. По данным авторов, модель поставила новые рекордные (state-of-the-art) результаты на английских, кросс-язычных и многоязычных версиях бенчмарков Visual STS (семантическая схожесть текста, распознанного по изображению) и ViDoRe (поиск документов по изображению), а также улучшает прикладные результаты мультимодальных больших языковых моделей (MLLM). Отдельно отмечается, что Pixel Linguist II сохраняет устойчивость даже при сжатии визуальных токенов на 80%, это авторы называют многообещающим для «оптического сжатия контекста», способа уменьшить число токенов, которые модель тратит на длинный текст, за счёт представления его в виде изображения. Код и материалы выложены на GitHub.
Ключевые факты
- Учёные провели контролируемые абляции и выделили четыре принципа устойчивого чтения текста по пикселям: переменное разрешение и размер шрифта при обучении, обязательные естественные пары «изображение-текст», отрисовка с сохранением вёрстки и двухэтапный многоязычный учебный план.
- На основе этих принципов создан кодировщик Pixel Linguist II, обученный на 280 миллионах примеров с отрисовкой текста «на лету» и многоязычным учебным планом.
- Pixel Linguist II показал новые рекордные результаты на английских, кросс-язычных и многоязычных версиях бенчмарков Visual STS и ViDoRe, а также улучшает прикладные результаты мультимодальных языковых моделей (MLLM).
- Модель сохраняет устойчивость при сжатии визуальных токенов на 80%, что авторы считают многообещающим для «оптического сжатия контекста».
- Код и материалы модели выложены в открытый доступ на GitHub.
Почему это важно
Работа не просто представляет ещё одну модель, а разбирает по частям, что вообще нужно, чтобы модель, которая читает текст напрямую по пикселям (а не по токенам), делала это надёжно. Такие кодировщики массово страдали от одних и тех же проблем: обучение на изображениях одного размера, из-за которого модель не переносится на реальные документы; склонность цепляться за поверхностные визуальные подсказки вместо содержания; слабая привязка распознанного текста к самому изображению; и плохое понимание многоязычных текстов. Авторы через контролируемые эксперименты показали, какие именно компоненты обучения устраняют каждую из этих проблем, и собрали из них единый рецепт, Pixel Linguist II.
Кому это важно
Инженерам и исследователям, которые строят поиск и извлечение информации по документам и изображениям (visual retrieval, поиск документов по изображению), мультимодальный RAG (поиск с дополнением генерации по картинкам и сканам) и системы, где текст на разных языках нужно распознавать и сопоставлять прямо по изображению, скриншотам, сканам, PDF со сложной вёрсткой. Отдельно, командам, которые ищут способы сократить число токенов, которые языковые модели тратят на длинный текст, за счёт представления его изображением («оптическое сжатие контекста»).
Как это применить
Код и материалы Pixel Linguist II выложены в открытый доступ на GitHub, модель можно использовать как готовый кодировщик изображений в пайплайнах поиска и сопоставления «текст-изображение», в том числе для многоязычных документов. Данных о цене, лицензии или ограничениях использования в источнике нет.
Можно ли доверять
Источник, страница препринта на Hugging Face Papers, то есть авторское описание собственной работы. Имена и принадлежность авторов текст статьи не приводит, поэтому в пересказе они не названы. Конкретных числовых значений на бенчмарках Visual STS и ViDoRe в источнике нет, есть только формулировка о новых рекордных результатах без указания модели, с которой сравнивали. Чтобы проверить заявленное превосходство, нужно смотреть саму статью и таблицы результатов, а не только аннотацию.
Риски и подводные камни
Заявление о рекордных результатах, это оценка самих авторов работы, независимого подтверждения или прямого сравнения с конкретными предыдущими моделями в материале нет. Не раскрыто, из чего состоят «унифицированная контрастная привязка» и два этапа многоязычного учебного плана, без полного текста статьи воспроизвести рецепт обучения не получится. Как и любой результат абляций, выводы могут не обобщаться на другие архитектуры или задачи за пределами протестированных бенчмарков.