Hi-Q обошёл IRCoT и PropRAG в ответах на многошаговые вопросы

Hi-Q обошёл IRCoT и PropRAG в ответах на многошаговые вопросы

Многошаговые вопросно-ответные системы (multi-hop QA, поиск ответа, требующий нескольких последовательных шагов извлечения данных) сталкиваются с постоянной проблемой: степень детализации, в которой сформулирован вопрос, часто не совпадает со степенью детализации, в которой можно найти подтверждающие фрагменты в корпусе документов. Существующие подходы решают это либо жёсткой графовой структурой поверх корпуса, либо итеративным переформулированием запроса, либо выполнением сгенерированной программы над корпусом, но ни один из них явно не решает, когда конкретный фрагмент запроса уже подтверждён найденными данными, а когда его нужно уточнять дальше.

Авторы описывают эту проблему как задачу «обнаружения извлекаемой степени детализации» и предлагают Hi-Q, фреймворк иерархического уточнения запроса, обусловленного найденными свидетельствами. В Hi-Q каждый узел запроса проверяется «оператором разрешения»: если найденные данные подтверждают текущий фрагмент запроса, узел завершается; если нет, узел разбивается на два дочерних запроса «оператором сохранения зависимостей», сохраняющим связь между ними, а результат проверяется «верификатором семантического покрытия». Таким образом дерево запроса растёт по мере того, как это подсказывают сигналы поддержки из корпуса, а не по заранее заданному шаблону разбиения или готовому графу.

Авторы проверили Hi-Q на трёх эталонных наборах для многошаговых вопросов, в основном в режиме поиска по всему открытому корпусу, где нужные подтверждающие фрагменты нужно находить среди множества посторонних документов, а не в узком заранее размеченном пуле. В этом режиме Hi-Q набирает в среднем 52,3 EM (exact match, точное совпадение ответа) и 64,0 F1 по трём тестам, это на 15,1 EM и 18,2 F1 больше, чем у базового метода итеративного поиска IRCoT, и на 11,5 EM и 12,0 F1 больше, чем у графового метода PropRAG на тесте MuSiQue-full, при этом Hi-Q обходится без построения графа по всему корпусу.

В более простом режиме, где корпус заранее ограничен подтверждающими документами и отвлекающими вариантами (такой режим использовался в прежних работах), Hi-Q тоже показывает лучший результат: в среднем 57,9 EM и 69,3 F1, что превышает PropRAG на 5,6 EM и 3,9 F1, а IRCoT, на 13,7 EM и 15,8 F1. Страница проекта доступна по адресу hi-q-project.github.io.

Ключевые факты

  • Hi-Q, фреймворк иерархического уточнения запроса для многошаговых вопросно-ответных систем: дерево запроса растёт по сигналам поддержки из корпуса, а не по фиксированному шаблону или готовому графу.
  • В режиме поиска по всему открытому корпусу Hi-Q набирает 52,3 EM и 64,0 F1 в среднем по трём тестам.
  • Hi-Q обходит итеративный метод IRCoT на 15,1 EM / 18,2 F1, а графовый метод PropRAG, на 11,5 EM / 12,0 F1 (на тесте MuSiQue-full).
  • В упрощённом режиме с заранее ограниченным корпусом Hi-Q тоже лидирует: 57,9 EM и 69,3 F1 в среднем, с отрывом от PropRAG в 5,6 EM / 3,9 F1 и от IRCoT в 13,7 EM / 15,8 F1.
  • Метод достигает этих результатов без построения графа по всему корпусу документов.

Почему это важно

Несовпадение детализации вопроса и детализации доступных в корпусе подтверждающих фрагментов, реальное узкое место многошаговых QA-систем: слишком общий или слишком конкретный запрос не находит нужный фрагмент. Прежние решения навязывают корпусу жёсткую графовую структуру или переформулируют запрос по шаблону, не проверяя явно, достаточно ли уже найденного. Hi-Q решает именно это: на каждом шаге проверяет, подтверждён ли фрагмент запроса найденными данными, и только при нехватке подтверждения делит его дальше, так что структура разбора запроса определяется самими данными, а не заранее заданной схемой.

Кому это важно

В первую очередь, разработчикам систем поиска ответов по открытым корпусам и retrieval-augmented (с подключением поиска) генерации: тем, кто строит многошаговый поиск по большим неразмеченным коллекциям документов, а не по узкому заранее подобранному набору. Результаты статьи ориентированы на исследователей и инженеров, сравнивающих методы извлечения и уточнения запросов между собой.

Как это применить

В тексте не упомянуто ни релиза кода, ни набора данных, указана только страница проекта hi-q-project.github.io. Практическое применение на сегодня ограничено изучением метода по статье и странице проекта; готового инструмента или API для интеграции в источнике не названо.

Можно ли доверять

Метод проверен количественно на трёх эталонных наборах данных в двух разных условиях поиска (полный открытый корпус и заранее ограниченный корпус), с прямым сравнением против двух конкретных базовых методов, IRCoT и PropRAG, и конкретными цифрами отрыва. В тексте не указаны имена авторов, институциональная принадлежность, дата публикации и место (конференция или журнал), поэтому независимо оценить рецензирование работы по одному только этому тексту нельзя.

Риски и подводные камни

Цифры, это самостоятельная оценка авторов метода на выбранных ими тестах, а не независимая проверка. Из трёх использованных тестовых наборов по имени назван только MuSiQue-full, какие ещё бенчмарки входят в среднее, из текста не ясно. Даже лучший результат Hi-Q в полном открытом корпусе (52,3 EM) в абсолютных числах остаётся далёким от идеального совпадения ответов, то есть на практике метод всё ещё регулярно ошибается на сложных многошаговых вопросах.