FineBooks: Hugging Face и EleutherAI оценили 14 OCR-моделей

Открытые языковые модели ИИ часто учат на книгах из общественного достояния, а их текст десятилетиями назад оцифровывали технологией оптического распознавания символов (OCR), и качество этого текста часто плохое. Проект Talkie посчитал ущерб от этого напрямую: модель, обученная на OCR-тексте, усваивает материал лишь с 30-процентной эффективностью по сравнению с моделью, обученной на текстах, которые вручную перепечатали люди.
FineBooks, совместный проект Hugging Face и EleutherAI, проверил, способны ли современные открытые OCR-модели решить эту проблему. Команда прогнала 14 открытых (по весам) моделей через 2165 страниц исторических книг и опубликовала результаты в виде рейтинга. Лучшие модели показали точность распознавания символов выше 97% при стоимости менее двух долларов за тысячу страниц.
Повод для проекта, масштаб задачи. Когда EleutherAI с партнёрами выпустили Common Pile, крупнейший на тот момент открыто лицензированный корпус для обучения ИИ, в него вошло около 300 000 книг из общественного достояния с текстом старых OCR-прогонов. Авторы FineBooks считают переобработку таких книг более качественными моделями одним из самых эффективных способов улучшить открытые обучающие датасеты. Первой целью выбрали Biodiversity Heritage Library (BHL), библиотеку из более чем 300 000 оцифрованных документов по естественной истории общим объёмом свыше 64 миллионов страниц; BHL распространяет коллекцию массовой выгрузкой через AWS. Чтобы измерить качество OCR, нужны страницы с заведомо верной расшифровкой: команда взяла материалы проектов IMPACT и BHL-Europe, в 2011, 2012 годах эксперты вручную перепечатали шесть томов BHL на английском, французском, немецком и латыни с ошибкой около одного символа на 2000; этот набор доступен по лицензии CC-BY на GitHub и лёг в основу эталонного датасета FineBooks.
Главный вывод рейтинга, размер модели не определяет качество распознавания старых текстов. Лидер, dots.mocr, использует всего 3 миллиарда параметров, тогда как Qwen3.5-9B, почти втрое крупнее, показал результат хуже. OvisOCR2 занял второе место с 0,9 миллиарда параметров и стоимостью 46 центов за тысячу страниц. Все 14 моделей работают локально без обращения к API. Метрика, частота ошибок по символам (CER); рейтинг считает её в двух вариантах: «дипломатический» засчитывает как ошибку осовременивание старинных символов (например, буквы «долгое s»), «читательский» такие замены не штрафует.
У методики есть чёткие границы: оценка охватывает только антикву (латинский шрифт) на четырёх языках и не включает готический шрифт, нелатинские системы письма и рукописный текст; FineBooks ограничен страницами с одной колонкой текста. Команда планирует переобработать одной из лучших моделей около 200 000 документов BHL из общественного достояния и выпустить результат как открытый датасет; рейтинг пополняется новыми моделями на постоянной основе, а сама методика оценки в открытом доступе.
Вывод авторов FineBooks: для обучения языковых моделей ИИ качество лучших моделей уже достаточное, они дают заметно меньше ошибок, чем старые пайплайны, а переобработать коллекцию масштаба BHL по таким расценкам реально. Для научной работы точности пока не хватает, но не из-за того, что модели неверно читают символы, а из-за того, что они незаметно осовременивают их, заменяя старинную букву «долгое s» или лигатуры на современные аналоги; по мнению команды, это можно исправить точечным дообучением. У библиотек, своя проблема: их инфраструктура держится на формате ALTO XML с координатами каждого слова на странице, а новые модели выдают Markdown или обычный текст без таких координат, поэтому напрямую встроить их в библиотечные системы не получается.
Ключевые факты
- FineBooks, проект Hugging Face и EleutherAI, протестировал 14 открытых OCR-моделей на 2165 страницах исторических книг
- Лучшая модель показала точность распознавания символов выше 97% при стоимости менее $2 за тысячу страниц
- Размер модели не определяет качество: лидер dots.mocr (3 млрд параметров) обошёл Qwen3.5-9B, который почти втрое крупнее; второе место занял OvisOCR2 (0,9 млрд параметров, 46 центов за тысячу страниц)
- Команда планирует переобработать около 200 000 документов Biodiversity Heritage Library и выпустить результат как открытый датасет
- Качества достаточно для обучения ИИ, но не для научной работы: модели не путают символы, а незаметно осовременивают старинные знаки вроде буквы «долгое s»
Почему это важно
Открытые языковые модели ИИ учатся на книгах из общественного достояния, а старая OCR-расшифровка этих книг часто содержит много ошибок, проект Talkie измерил, что модель на OCR-тексте усваивает материал лишь с 30-процентной эффективностью от модели, обученной на человеческой расшифровке тех же книг. FineBooks показывает, что современные открытые OCR-модели уже способны закрыть этот разрыв: лучшие дают точность выше 97% по символам при цене меньше $2 за тысячу страниц, а сама переобработка старых сканов, по оценке авторов проекта, один из самых эффективных способов улучшить открытые обучающие датасеты.
Кому это важно
Тем, кто собирает или использует открытые обучающие корпуса для ИИ (сообщества вокруг Hugging Face, EleutherAI и подобных открытых датасетов), рейтинг даёт готовый ориентир, какую OCR-модель выбрать по соотношению цены и качества. Также важно цифровым библиотекам и архивам вроде Biodiversity Heritage Library, у которых накоплены миллионы страниц со старой, некачественной OCR-расшифровкой.
Как это применить
Все 14 моделей из рейтинга открыты по весам и запускаются на своём оборудовании без ключа API, их можно взять напрямую для переобработки собственной коллекции сканов. Рейтинг и методика оценки в открытом доступе и пополняются новыми моделями, так что решение о выборе модели можно периодически пересматривать по актуальным цифрам, а не по разовому снимку результатов.
Можно ли доверять
Источник, полноценная статья с описанием методики: эталонные расшифровки для сравнения взяты у экспертов проектов IMPACT и BHL-Europe (2011, 2012 годы, ошибка около одного символа на 2000), выложены по лицензии CC-BY на GitHub, а сам рейтинг и фреймворк оценки открыты для проверки. В материале не названы конкретные исследователи, только организации Hugging Face и EleutherAI и обобщённое «команда», поэтому персональную атрибуцию результатов дать нельзя, но методика в целом прозрачна и воспроизводима.
Риски и подводные камни
Оценка охватывает только антикву на четырёх языках (английский, французский, немецкий, латынь) и не включает готический шрифт, нелатинские системы письма, рукописный текст и многоколоночную вёрстку, за пределами этого набора выводы рейтинга не проверены. Для научных и архивных задач точности всё ещё не хватает: модели незаметно осовременивают старинные символы и лигатуры, что для обучения ИИ не критично, но искажает источник для филологической работы. У библиотек отдельная техническая проблема, новые модели не выдают координаты слов на странице, необходимые формату ALTO XML, поэтому встроить их в существующую библиотечную инфраструктуру напрямую нельзя.