InSight-doc: агент для документов снижает галлюцинации на 40%

Понимание длинных документов часто требует анализа множества визуально насыщенных страниц, что делает вывод модели дорогим и подверженным «context rot» (потере точности из-за перегруженного контекста).
Авторы предлагают InSight-doc, агентную систему визуального восприятия, которая рассматривает разрешение изображения как ресурс, который можно тратить адаптивно во время рассуждения. Система начинает работу с документом с низкого разрешения и сама выбирает, в какие области страницы «приблизиться» (zoom-in) для получения более чёткого изображения нужных деталей, без обращения к внешнему модулю поиска (retriever).
Для обучения такого агента авторы собрали корпус активного восприятия: 17,9 тыс. качественных примеров для дообучения с учителем (SFT) с траекториями приближения по регионам страницы и ещё 19,2 тыс. сложных примеров для обучения с подкреплением (RL). Модель обучили комбинацией SFT и RL.
На тестах document VQA (вопросно-ответных заданиях по документам) версия InSight-doc-8B (8 миллиардов параметров) превосходит базовую модель на 4,3, 16,4 процентных пункта точности. На длинных документах система снижает долю галлюцинаций более чем на 40% и задержку вывода на 41, 68%, при этом сохраняя преимущество в точности. Код, датасеты и модель авторы выложили в открытый доступ на GitHub.
Ключевые факты
- InSight-doc, агентная система визуального восприятия для длинных документов: сама приближает нужные участки страницы вместо внешнего поиска (retriever).
- Обучена на 17,9 тыс. примеров SFT с траекториями приближения и 19,2 тыс. сложных примеров RL.
- Версия InSight-doc-8B опережает базовую модель на 4,3, 16,4 процентных пункта точности на тестах document VQA.
- На длинных документах снижает галлюцинации более чем на 40% и задержку вывода на 41, 68%, сохраняя точность.
- Код, датасеты и модель выложены в открытый доступ на GitHub.
Почему это важно
Длинные документы с картинками, таблицами и сканами, слабое место современных мультимодальных моделей: чтобы найти нужную деталь, модель вынуждена обрабатывать множество страниц целиком в высоком разрешении, что дорого и повышает риск ошибок и потери точности на большом объёме контекста. InSight-doc решает это адаптивно, тратит высокое разрешение только там, где это нужно для ответа, а не на весь документ сразу.
Кому это важно
Разработчикам ИИ-систем для работы с документами, юридическими, финансовыми, научными архивами, сканами форм и отчётов, где документы визуально насыщены (таблицы, диаграммы, мелкий текст) и состоят из десятков страниц. Полезно и исследователям мультимодальных моделей, которые ищут способ снизить стоимость вывода без потери точности.
Как это применить
Авторы выложили код, обучающие датасеты (SFT- и RL-корпуса) и веса модели InSight-doc-8B в открытый доступ на GitHub, так что систему можно воспроизвести, дообучить под свои документы или использовать как готовый компонент для конвейеров document VQA.
Можно ли доверять
Публикация, препринт на HuggingFace Papers, в самом тексте не указаны авторы (кроме имени первого автора в метаданных источника) и аффилиации, площадка публикации и статус рецензирования. Названия конкретных бенчмарков document VQA и модели-базы для сравнения в тексте не раскрыты. Цифры (17,9 тыс./19,2 тыс. примеров, 4,3, 16,4 п.п., более 40%, 41, 68%), самоотчёт авторов, независимой проверки нет.
Риски и подводные камни
Раз конкретные бенчмарки и базовая модель для сравнения не названы, сопоставить результат с другими работами по той же метрике сложно. Условия лицензирования выложенного кода, датасетов и модели в тексте не указаны, это стоит проверить перед использованием в продакшене.