ScriptMoE: единая модель распознаёт текст на 229 языках

ScriptMoE: единая модель распознаёт текст на 229 языках

Многоязычное распознавание текста на изображениях (scene text recognition) остаётся сложной задачей: для большинства языков не хватает обучающих данных, а обслуживание разных систем письма в рамках одной модели затруднено. По словам авторов работы, существующие решения либо разворачивают отдельный распознаватель для каждого языка, это увеличивает расходы и накапливает ошибки, либо полагаются на крупные мультимодальные (vision-language) модели, которые дороги и всё равно ошибаются на многих системах письма.

Авторы предложили два компонента. Первый, TextMuSS-10M, крупный синтетический набор данных, охватывающий 10 систем письма и 229 языков; он даёт достаточное и сбалансированное обучающее покрытие там, где реальных размеченных данных не хватает. Второй, ScriptMoE, архитектура со смесью экспертов (Mixture-of-Experts, MoE), учитывающая систему письма. Модель использует единый визуальный энкодер для всех языков, а плотный декодер заменён разреженным MoE-блоком: маршрутизатор на уровне изображения направляет каждое изображение к двум (top-2) экспертам, специализирующимся на конкретных системах письма, а общий (shared) эксперт накапливает знания, полезные сразу для всех письменностей.

Авторы собрали собственный тестовый набор TextMuSS-Bench из 10 систем письма и 10 899 изображений. На нём ScriptMoE показала точность 82,06%, на 1,31% выше лучшего из существующих распознавателей STR. В сквозном (end-to-end) тесте CC-OCR на многоязычных данных замена только модуля распознавания в системе PP-OCRv5 на ScriptMoE подняла показатель F1 с 65,71% до 80,89%, что немного превзошло лучшую мультимодальную модель (80,73%). При этом, по утверждению авторов, ScriptMoE использует лишь малую долю параметров по сравнению с этой моделью.

Ключевые факты

  • TextMuSS-10M, синтетический набор данных для обучения, охватывающий 10 систем письма и 229 языков
  • ScriptMoE использует единый визуальный энкодер и разреженный MoE-блок: маршрутизатор направляет каждое изображение к 2 экспертам по системе письма плюс общий эксперт
  • На собственном бенчмарке TextMuSS-Bench (10 систем письма, 10 899 изображений) ScriptMoE достигла точности 82,06%, превзойдя лучший существующий распознаватель STR на 1,31%
  • В тесте CC-OCR замена распознавателя в PP-OCRv5 на ScriptMoE подняла F1 с 65,71% до 80,89%, немного обойдя лучшую мультимодальную модель (80,73%) при заметно меньшем числе параметров

Почему это важно

Многоязычное распознавание текста на изображениях страдает от нехватки данных почти для всех языков, кроме нескольких крупных. Обычно эту проблему решают либо набором отдельных моделей под каждый язык (дорого и накапливает ошибки), либо тяжёлыми мультимодальными моделями (дорого и всё равно неточно на многих системах письма). ScriptMoE предлагает единую компактную модель, которая, по данным авторов, точнее обоих подходов сразу на 229 языках.

Кому это важно

Разработчикам систем оптического распознавания текста (OCR), компаниям, которым нужно обрабатывать документы, вывески и сцены на множестве языков и систем письма, а также исследователям, работающим над архитектурами смеси экспертов и мультиязычным зрением.

Как это применить

Авторы показали, что ScriptMoE можно встроить как замену модуля распознавания в существующий OCR-конвейер: в эксперименте с PP-OCRv5 такая замена заметно подняла точность (F1) без перехода на тяжёлую мультимодальную модель. Вместе с работой опубликованы синтетический набор для обучения TextMuSS-10M и тестовый набор TextMuSS-Bench, которые можно использовать для обучения и сравнения собственных распознавателей.

Можно ли доверять

Материал, научная публикация с подробным описанием архитектуры и результатов на собственном и стороннем (CC-OCR) бенчмарках, все приведённые цифры взяты из текста работы. При этом в тексте не указаны имена авторов, их институциональная принадлежность и дата публикации, поэтому независимо оценить репутацию авторов или новизну заявленных результатов по одному этому тексту нельзя.

Риски и подводные камни

Обучающий набор TextMuSS-10M синтетический, а не собранный из реальных фотографий, что может создавать разрыв между обучением и реальными условиями применения. Абсолютное число параметров ScriptMoE и сравниваемой мультимодальной модели в тексте не приводится, только формулировка о «малой доле параметров». Сроки и условия публикации кода, весов модели или самих наборов данных в источнике не указаны.