BM25 обходит нейросетевые методы поиска в RAG на больших массивах данных

BM25 обходит нейросетевые методы поиска в RAG на больших массивах данных

Технология RAG (retrieval-augmented generation, генерация с подкреплением поиском) объединяет разные подходы к поиску нужных документов: лексический поиск по ключевым словам, плотный поиск (dense retrieval) по смысловым векторам, поиск по графовым индексам и агентный поиск, где ИИ-агент сам исследует базу данных. Проблема в том, что эти подходы обычно тестируют на разных наборах данных и при одном фиксированном размере базы, поэтому неясно, как точность и затраты меняются с ростом объёма данных.

Пенгю Ван с соавторами провели контролируемое исследование: они наращивали размер корпуса документов по 28 строго вложенным друг в друга уровням, покрывающим рост примерно в 450 раз, при этом сохраняя неизменными вопросы и фиксированный базовый набор («бедрок») релевантных и обманных (adversarial) документов. Все методы тестировали с одной и той же моделью-«читателем» и по единому протоколу оценки, замеряя официальную точность, число токенов на построение индекса и на запрос, а также задержку ответа.

Итог, не безусловный победитель, а зависящий от масштаба перелом. На самых маленьких уровнях базы лидирует File-System Agent, агент, который последовательно исследует файловую систему, но такой последовательный поиск обходится в 39 раз дороже по токенам на запрос уже при базовом размере данных и теряет эффективность по мере роста базы. Примерно на отметке в 10 миллионов токенов корпуса классический алгоритм BM25 (лексический поиск по ключевым словам) обгоняет агента и дальше лидирует на всех более крупных уровнях, а на полном масштабе разрыв приближается к 20 баллам точности. При этом BM25 держит нижнюю границу затрат на кривой Парето (соотношение точность/цена), поскольку не требует построения индекса силами LLM.

Плотный поиск (dense retrieval) остаётся экономичным по затратам, но менее точным. Поиск по графовым индексам упирается в стену построения индекса ещё до промышленного масштаба, а его более масштабируемые варианты всё равно уступают BM25 на сопоставимых уровнях.

Общий вывод авторов: с ростом объёма данных выигрывает глобальное ранжирование кандидатов. Лексический поиск остаётся самым сильным и масштабируемым решением по умолчанию, а агентные рассуждения работают лучше всего после ранжированного поиска, а не вместо него.

Ключевые факты

  • Контролируемое исследование варьировало размер корпуса по 28 вложенным уровням, покрывая рост примерно в 450 раз, при неизменных вопросах и базовом наборе документов.
  • На малых объёмах данных лидирует агент File-System Agent, но его последовательный поиск обходится в 39 раз дороже по токенам запроса уже на старте.
  • Начиная примерно с 10 миллионов токенов корпуса, BM25 обгоняет агента и лидирует на всех крупных уровнях; на полном масштабе разрыв достигает почти 20 баллов точности.
  • BM25 держит нижнюю границу затрат на кривой Парето точность/цена, поскольку не требует построения индекса с помощью LLM.
  • Поиск по графовым индексам упирается в стену построения индекса ещё до промышленного масштаба и уступает BM25 на сопоставимых уровнях.

Почему это важно

Индустрия RAG во многом исходит из того, что более сложные методы, плотный поиск по смысловым векторам, графовые индексы, агенты, которые сами исследуют базу, точнее простого лексического поиска. Исследование ставит это под сомнение: при честном сравнении на одинаковом протоколе и растущем объёме данных обычный BM25, известный алгоритм ранжирования по ключевым словам без нейросетей, обгоняет более дорогие и сложные альтернативы уже на корпусах среднего размера.

Кому это важно

Разработчикам и архитекторам RAG-систем, компаниям, которые строят поиск и вопрос-ответные системы поверх больших корпусов документов, а также исследователям, оценивающим экономику поисковых пайплайнов при масштабировании.

Как это применить

Вывод исследования, при росте базы документов имеет смысл закладывать BM25 как основной, самый дешёвый по построению индекса и масштабируемый метод поиска, а не отказываться от него в пользу нейросетевых альтернатив по умолчанию. Плотный поиск можно использовать там, где важна экономичность и корпус не слишком велик. Агентный поиск, по данным работы, эффективнее применять как надстройку после того, как кандидаты уже отобраны и проранжированы обычным поиском, а не вместо него с нуля.

Можно ли доверять

Методология выглядит достаточно строгой для одной работы: 28 строго вложенных уровней размера корпуса, фиксированные вопросы и базовый набор документов, единая модель-читатель и единый протокол оценки для всех сравниваемых методов, это снижает риск того, что разница в результатах вызвана разными условиями тестирования, а не самими методами. При этом это одна публикация (страница на Hugging Face Papers), выводы получены на конкретном тестовом стенде и конкретной реализации агентного поиска (File-System Agent), а не подтверждены независимыми повторениями.

Риски и подводные камни

Результаты могут не переноситься один в один на другие домены данных, другие реализации агентного и графового поиска или другие модели-читатели, исследование фиксирует конкретную экспериментальную установку. «Агентный поиск» в работе представлен одной архитектурой (File-System Agent), и её издержки по токенам не обязательно характеризуют все агентные подходы к поиску. Кроме того, вывод о превосходстве BM25 сделан для сценария с растущим объёмом данных, на небольших корпусах картина, по данным той же работы, может быть иной.