DocAtlas: агент с изменяемым состоянием обошёл людей на тесте MMLongBench-Doc

Понимание длинных документов требует находить и сопоставлять свидетельства на множестве страниц, в разной вёрстке, таблицах, схемах и графиках. По словам авторов, системы с поиском по индексу (RAG) обычно отбирают свидетельства из статичного индекса ещё до генерации ответа, а более новые агентные системы добавляют многошаговое использование инструментов, но чаще всего работают поверх закрытых фиксированных моделей, чьё поведение задаётся только промптом.

Авторы представляют DocAtlas, систему, которая рассматривает понимание длинного документа как процесс с изменяемым состоянием: внешняя среда (обвязка) сама решает, какая информация из документа ищется, читается, сохраняется, пересматривается и показывается модели на каждом шаге. Для документа и вопроса обвязка даёт агенту инструменты поиска, чтения, заметок и повторного просмотра, ведёт иерархическое дерево документа и хранилище заметок и обновляет их по мере того, как агент фиксирует найденные свидетельства. Так DocAtlas сочетает самоулучшающийся поиск, избирательный доступ к свидетельствам и активную рабочую память в рамках фиксированного бюджета контекста.

Одна и та же обвязка используется двумя способами: как инструмент для вывода с крупными визуально-языковыми моделями (VLM) без дообучения и как среда для сквозного обучения с подкреплением (RL) компактных VLM-агентов.

С моделью GPT-5.4 DocAtlas набирает 71,4% на бенчмарке MMLongBench-Doc, превышая ориентир по эталонному результату людей-экспертов в 65,8%. Компактная модель Qwen3.5-4B, дообученная сквозным RL внутри среды DocAtlas, достигает 63,7%, против 54,4% у той же модели без обвязки, при прямой подаче документа в контекст. Авторы делают вывод, что архитектура изменяемой документной обвязки заметно повышает качество компактных агентов для работы с документами.

Ключевые факты

  • DocAtlas, внешняя обвязка с изменяемым состоянием для длинных документов, а не статичный индекс для поиска-и-генерации.
  • Агенту доступны инструменты поиска, чтения, заметок и повторного просмотра над иерархическим деревом документа и хранилищем заметок.
  • С GPT-5.4 система набрала 71,4% на MMLongBench-Doc, выше эталонного результата людей-экспертов (65,8%).
  • Компактная модель Qwen3.5-4B, дообученная сквозным RL внутри среды DocAtlas, достигла 63,7% против 54,4% у той же модели без обвязки.
  • Одна и та же среда работает и как инструмент вывода для крупных VLM без дообучения, и как площадка для RL-обучения компактных агентов.

Почему это важно

Существующие подходы к длинным документам делятся на два лагеря: статичный поиск-и-генерация, где свидетельства отбираются из индекса заранее, и агентные системы с многошаговыми инструментами, но поверх закрытых моделей, чьё поведение полностью держится на промпте. DocAtlas меняет саму архитектуру: то, что модель видит на каждом шаге, определяет внешняя изменяемая среда, а не статичный контекст или чужой промпт. По заявленным числам это даёт заметный прирост, вплоть до превышения эталонного результата людей-экспертов на тестовом бенчмарке.

Кому это важно

Разработчикам агентных систем и инструментов для работы с большими массивами документов, юридической и финансовой аналитикой, научными обзорами, где ответ разбросан по десяткам страниц, таблиц и графиков. А также исследователям, которые обучают компактные модели через RL: результат показывает, что архитектура окружения может значить не меньше размера самой модели.

Как это применить

Одна и та же обвязка работает в двух режимах без переделки: как надстройка для вывода поверх уже готовой крупной VLM (GPT-5.4) без дополнительного обучения, и как среда для сквозного RL-обучения компактной модели (Qwen3.5-4B) агентному поведению, поиску, чтению, заметкам, пересмотру, в рамках ограниченного бюджета контекста, вместо того чтобы пытаться втиснуть весь документ в контекст целиком.

Можно ли доверять

Работа опубликована как препринт на arXiv; в самой аннотации не названы ни авторы, ни организация, ни площадка публикации, ни релиз кода или датасета. Приведённые цифры, это собственная оценка авторов на бенчмарке MMLongBench-Doc; независимой проверки или воспроизведения результата пока нет.

Риски и подводные камни

Результаты привязаны к одному бенчмарку (MMLongBench-Doc), и неясно, насколько они переносятся на другие типы документов и задач. Сравнение с «эталонным результатом людей-экспертов», фиксированное число из методики самого бенчмарка, детали его получения в этом источнике не раскрыты. Код не опубликован, что мешает независимой проверке. Компактная модель с обвязкой (63,7%) всё ещё заметно уступает крупной модели с той же обвязкой (71,4%), разрыв в качестве RL-обучение полностью не закрывает.