ExtractBench: LlamaExtract Agentic Plus обошёл коммерческие ИИ-модели в извлечении данных из документов

Боян Чжан с соавторами представили ExtractBench, бенчмарк для оценки ИИ-агентов, которые извлекают структурированные данные из документов по заданной пользователем схеме и должны подтверждать каждый результат ссылкой на источник в самом документе. По утверждению авторов, это первый бенчмарк, который одновременно измеряет точность значений, полноту записей в большом масштабе, привязку к источнику (grounding) и реальную стоимость обработки.
Оценочный набор включает 4869 страниц из 370 корпоративных документов, охватывающих 8 бизнес-доменов и 67 типов документов; каждый документ размечен тегами сложности сценария. Эталонные значения для разметки собирали тремя способами: для реальных документов, через согласие независимых систем извлечения, для синтетических списков, по заранее известным значениям, для форм, через ручную проверку человеком.
Точность измеряется через F1-меру по значениям без учёта порядка записей, а привязка к источнику, через две метрики grounding: F1 на уровне слов и F1 на уровне страниц. По результатам тестирования коммерческие модели с распознаванием изображений (VLM) хорошо справляются с короткими документами, но часто обрезают списки записей на длинных; кодинг-агенты сохраняют более высокую точность, но обходятся значительно дороже. Инструмент LlamaExtract Agentic Plus занял первое место сразу по всем трём метрикам, показав точность на уровне кодинг-агентов при затратах, составляющих лишь малую долю их стоимости. Набор данных и код для оценки авторы выложили в открытый доступ на HuggingFace (аккаунт llamaindex) и GitHub (аккаунт run-llama).
Ключевые факты
- ExtractBench впервые одновременно оценивает точность значений, полноту записей, привязку к источнику и стоимость извлечения данных
- Набор для оценки: 4869 страниц, 370 корпоративных документов, 8 бизнес-доменов, 67 типов документов
- Эталонная разметка собрана тремя способами: согласие независимых систем, известные значения для синтетических списков, ручная проверка форм людьми
- Коммерческие VLM хорошо работают на коротких документах, но обрезают списки записей на длинных; кодинг-агенты точнее, но заметно дороже
- LlamaExtract Agentic Plus занял первое место по всем трём метрикам с точностью на уровне кодинг-агентов при доле их стоимости
Почему это важно
Компании всё чаще поручают ИИ-агентам извлекать структурированные данные из документов по заданной схеме, но до сих пор не было единого способа сравнить такие системы сразу по точности, полноте, проверяемости результата и стоимости. ExtractBench закрывает этот пробел: он не просто меряет, насколько точны извлечённые значения, но и проверяет, действительно ли агент может обосновать каждый результат ссылкой на конкретное место в документе, и во сколько это обходится.
Кому это важно
Бенчмарк адресован командам, которые строят или выбирают системы обработки корпоративных документов, счетов, форм, договоров и других деловых бумаг: разработчикам ИИ-агентов для извлечения данных, интеграторам, сравнивающим коммерческие модели с изображениями (VLM), кодинг-агентов и специализированные инструменты вроде LlamaExtract, а также аналитикам, которым важно не только качество результата, но и его стоимость в масштабе.
Как это применить
Набор данных ExtractBench и код для оценки выложены в открытом доступе на HuggingFace (аккаунт llamaindex) и GitHub (аккаунт run-llama), поэтому команды могут прогнать через него собственные системы извлечения и сравнить результат с уже протестированными инструментами. Из выводов бенчмарка следует практическое правило выбора: для коротких документов подойдут коммерческие VLM, для длинных с большими списками записей, агентные инструменты вроде LlamaExtract Agentic Plus, которые сочетают точность кодинг-агентов с намного меньшей стоимостью.
Можно ли доверять
Источник, аннотация статьи с описанием методологии: эталонная разметка собиралась тремя разными способами в зависимости от типа документа, включая ручную проверку людьми для форм, а сами метрики точности и привязки к источнику определены явно. Вместе с тем стоит учитывать, что и датасет, и код оценки опубликованы под аккаунтами llamaindex и run-llama, тем же проектом, который разрабатывает победивший LlamaExtract Agentic Plus, поэтому для независимой проверки результатов стоит дождаться воспроизведений сторонними командами.
Риски и подводные камни
В тексте не приведены конкретные числовые значения F1 для LlamaExtract Agentic Plus или других протестированных систем, только относительные места в рейтинге и качественные сравнения. Также не указаны точные суммы затрат на обработку для кодинг-агентов и LlamaExtract (только формулировка «доля их стоимости»), не названы дата публикации, площадка или конференция, а также авторский состав и аффилиации помимо первого автора. Это ограничивает возможность точно оценить масштаб превосходства до появления более подробных данных.