HPD-Parsing ускоряет разбор документов ИИ в 2,62 раза

HPD-Parsing ускоряет разбор документов ИИ в 2,62 раза

Существующие унифицированные парсеры документов на основе VLM (Vision-Language Model) обрабатывают страницу как единое целое: модель анализирует макет и содержимое совместно, но генерирует итоговый текст одним последовательным авторегрессионным потоком токенов. Из-за этого возникает узкое место, которое растёт вместе с длиной документа, чем больше текста на странице, тем дольше идёт разбор, потому что каждый токен вычисляется строго по очереди.

Шу Вэй с соавторами обращают внимание на особенность самой задачи: макет страницы (расположение блоков, их иерархия) действительно нужно анализировать глобально, но содержимое отдельных блоков можно распознавать параллельно, независимо друг от друга. На основе этого наблюдения авторы предложили HPD-Parsing, парадигму иерархического параллельного декодирования (Hierarchical Parallel Decoding), которая заменяет последовательную генерацию всей страницы. Главная ветка модели размечает общую структуру документа и динамически распределяет разбор содержимого каждого блока по параллельным веткам, работающим одновременно. Внутри каждой такой ветки число шагов декодирования дополнительно сокращает техника прогрессивного предсказания нескольких токенов за раз (progressive multi-token prediction, P-MTP).

На публичных бенчмарках HPD-Parsing показал скорость 4752 токена в секунду, это в 2,62 раза быстрее самого быстрого из существующих парсеров документов и в 3,06 раза быстрее базовой (vanilla) авторегрессионной модели. При этом, по заявлению авторов, точность разбора документов остаётся сопоставимой с прежними подходами. Авторы называют иерархическое параллельное декодирование рабочей альтернативой полностраничной авторегрессионной генерации и новым направлением для эффективного разбора документов унифицированными моделями.

Ключевые факты

  • Существующие унифицированные VLM-парсеры документов генерируют весь текст страницы одним последовательным потоком токенов, узкое место, растущее с длиной документа.
  • HPD-Parsing вводит иерархическое параллельное декодирование: главная ветка размечает общую структуру макета, а содержимое каждого блока разбирается параллельно в отдельных ветках.
  • Дополнительно применяется прогрессивное предсказание нескольких токенов (P-MTP), сокращающее число шагов декодирования внутри каждой ветки.
  • На публичных бенчмарках метод достиг 4752 токенов в секунду, в 2,62 раза быстрее самого быстрого существующего парсера документов и в 3,06 раза быстрее базовой авторегрессионной модели.
  • Точность разбора при этом остаётся сопоставимой с прежними подходами, по данным авторов.

Почему это важно

Разбор документов (парсинг PDF, сканов, страниц с сложной вёрсткой) моделями VLM, базовый шаг для многих ИИ-пайплайнов: извлечения данных, подготовки датасетов, поиска по документам. До сих пор узкое место было структурным, единая модель обязана генерировать весь текст страницы токен за токеном последовательно, и это время растёт линейно с длиной документа. HPD-Parsing показывает, что часть работы (разбор содержимого блоков) можно распараллелить, не жертвуя качеством разметки макета, это принципиально иной подход к архитектуре парсера, а не просто оптимизация уже существующей.

Кому это важно

В первую очередь, разработчикам систем распознавания и извлечения информации из документов: компаниям, которые строят пайплайны OCR/document AI поверх VLM, обрабатывают большие объёмы PDF, сканов, счетов, форм и других многостраничных документов, где скорость разбора напрямую влияет на стоимость и время обработки.

Как это применить

HPD-Parsing описан как исследовательская архитектура и метод, а не готовый продукт с релизом или ценой, в тексте нет упоминаний открытого кода, весов модели или лицензии. Практический интерес для разработчиков, сама идея: разделить задачу на глобальную разметку макета (последовательную) и параллельный разбор содержимого блоков, дополнив её прогрессивным предсказанием нескольких токенов. Это направление стоит держать в поле зрения при выборе или проектировании собственных парсеров документов на базе VLM.

Можно ли доверять

Материал опубликован на странице препринтов Hugging Face Papers, собрал скромные 8 очков и 2 комментария, независимой проверки результатов на момент публикации нет. Цифры (4752 токена/с, ускорение в 2,62 и 3,06 раза, сопоставимая точность), заявления самих авторов по итогам тестов на публичных бенчмарках, а не независимых замеров.

Риски и подводные камни

Работа на стадии препринта: нет сведений об открытом коде, весах модели или её доступности для повторения результатов сторонними. Выигрыш в скорости измерен на конкретных публичных бенчмарках, насколько он сохранится на реальных, более разнородных документах со сложной вёрсткой, из текста не следует.