AutoIndex учит ИИ-агентов оптимизировать индексацию документов и поднимает точность поиска до 30%

AutoIndex учит ИИ-агентов оптимизировать индексацию документов и поднимает точность поиска до 30%

Исследователи представили AutoIndex, фреймворк, который учится не настраивать параметры ретривера или реранкера, а искать сами «программы представления»: исполняемые преобразования, которые режут документы на части, обогащают их, нормализуют, переупорядочивают и перевзвешивают перед индексацией. Идея в том, что то, как документ представлен в индексе, обычно считают фиксированным шагом препроцессинга, AutoIndex делает его явной целью оптимизации. Метод работает итеративно: на каждом шаге ИИ-агенты диагностируют, в чём именно текущая программа индексации даёт сбои на валидационных данных, синтезируют кандидатов на замену, и в итоговую программу попадают только те изменения, что реально улучшают качество поиска после переиндексации. Ретривер во всех экспериментах не меняли, использовали BM25. Фреймворк проверили на CRUMB, бенчмарке из 8 разнородных задач поиска. Выученные программы индексации обошли базовый вариант со статичной полнодокументной обработкой BM25 на всех 8 задачах: средний прирост составил +8.4% по метрике Recall@100 и +8.3% по nDCG@10, а на отдельных задачах прирост доходил до +30.5% по Recall@100 и +43.6% по nDCG@10. Авторы делают вывод, что представление документа в поисковой системе стоит рассматривать не как фиксированный выбор до начала поиска, а как отдельную величину, которую можно и нужно оптимизировать. Код для воспроизведения результатов выложен на GitHub (auto-index/autoindex).

Ключевые факты

  • AutoIndex ищет не параметры ретривера, а сами программы предобработки документов, как их резать на части, обогащать, нормализовать и переупорядочивать перед индексацией.
  • ИИ-агенты на каждой итерации диагностируют сбои текущей программы индексации и предлагают кандидатов на замену; в индекс попадают только изменения, подтверждённо улучшающие качество поиска на валидации.
  • На бенчмарке CRUMB (8 разнородных задач поиска, ретривер BM25 неизменен) выученные программы обошли статичную полнодокументную обработку на всех 8 задачах.
  • Средний прирост, +8.4% по Recall@100 и +8.3% по nDCG@10; максимальный, +30.5% по Recall@100 и +43.6% по nDCG@10.
  • Код для воспроизведения результатов выложен в открытом доступе на GitHub (auto-index/autoindex).

Почему это важно

Обычно при настройке поисковых систем тюнят ретривер, реранкер или горстку гиперпараметров препроцессинга, а то, как именно документ представлен в индексе, считают фиксированным шагом, сделанным до начала поиска. AutoIndex переворачивает эту логику: подготовка документа, нарезка на фрагменты, обогащение, нормализация, переупорядочивание содержимого, становится явной целью оптимизации, которую ищут программно, а не задают руками один раз и навсегда.

Кому это важно

Разработчикам поисковых систем и RAG-конвейеров, где качество ответа сильно зависит от того, что именно попадает в индекс и как оно нарезано на фрагменты, юридический, медицинский поиск, поиск по технической документации и другие области с разнородными, сложно устроенными документами.

Как это применить

Метод устроен как программный поиск: на каждой итерации ИИ-агенты диагностируют, где текущая программа индексации ошибается, синтезируют кандидатов на замену и оставляют только те, что подтверждённо улучшают качество поиска на валидационных данных. Сам ретривер (в экспериментах, BM25) при этом не меняется: вся выгода приходит от того, как устроен индекс. Код для воспроизведения выложен на GitHub (auto-index/autoindex), что позволяет прогнать метод на своих данных.

Можно ли доверять

Результаты получены на CRUMB, бенчмарке из 8 разнородных задач поиска; выученные программы индексации обошли фиксированную обработку документов на всех восьми задачах при неизменном ретривере BM25, что снижает риск случайной удачи на одной-двух задачах. Заявленные цифры (в среднем +8.4% по Recall@100, максимум +30.5%) взяты из текста самой статьи; независимой проверки за пределами авторского бенчмарка пока нет.

Риски и подводные камни

Метод завязан на ИИ-агентов, которые сами генерируют и проверяют кандидатов на программы индексации, это дополнительные вычислительные затраты на этапе построения индекса, и в тексте не сказано, насколько дорог такой поиск программ. Не уточняется и то, переносятся ли выученные программы индексации на новые домены без повторного прогона. Сравнение проведено только с BM25, а не с современными нейросетевыми ретриверами, насколько прирост сохранится поверх более сильных базовых систем поиска, из статьи не ясно.