PRO-Step: метод пошаговой оптимизации вознаграждений для RAG

RAG (генерация ответов с опорой на внешний поиск) усиливает языковые модели, подключая к ним внешние источники, но при многошаговых (multi-hop) вопросах, где ответ требует нескольких последовательных шагов поиска и рассуждения, ошибка на раннем шаге поиска сбивает все последующие шаги, ошибки накапливаются по цепочке. Стандартное обучение с вознаграждением по итоговому ответу (outcome-based) видит только финальный результат и не замечает, что где-то в середине цепочки поиск подобрал не те факты или рассуждение свернуло не туда. Более новые пошаговые (process-based) методы вводят сигнал на уровне каждого отдельного шага, но по-прежнему сверяют этот шаг с итоговым ответом, из-за этого они поощряют случаи, когда ошибочный поиск случайно всё равно привёл к правильному ответу («ложный успех»).

Авторы предлагают PRO-Step. Ключевая идея, оценивать каждый шаг сразу по двум критериям: логической корректности рассуждения и подкреплённости найденными фактами (evidential grounding), а не только по совпадению с финальным ответом. Для этого обучается генеративная модель вознаграждения процесса (PRM), которая даёт такую двойную оценку. С её помощью строится дерево вариантов шага (value tree search): PRM сравнивает разные варианты одного и того же шага и формирует пары «верный шаг против ошибочного». На этих парах политика модели дообучается методом пошаговой прямой оптимизации предпочтений (step-level DPO).

В экспериментах на наборах данных с одно- и многошаговыми вопросами (single- and multi-hop QA) PRO-Step показал лучшую среднюю точность по метрикам EM (точное совпадение ответа) и F1 сразу на пяти бенчмарках среди сравниваемых методов. Конкретные числовые показатели, названия бенчмарков, сравниваемые методы и авторы работы в тексте аннотации не указаны. Код, обученные модели и обучающие данные авторы выложили в открытый доступ на GitHub.

Ключевые факты

  • RAG усиливает языковые модели подключением внешнего поиска, но при многошаговых (multi-hop) вопросах ошибка на раннем шаге поиска сбивает всю последующую цепочку рассуждений.
  • Обучение по итоговому ответу не видит промежуточных ошибок; более ранние пошаговые методы тоже сверяют каждый шаг с финальным ответом и поэтому поощряют случайные «правильные ответы» при ошибочном поиске.
  • PRO-Step обучает генеративную модель вознаграждения процесса (PRM), которая оценивает каждый шаг сразу по двум критериям: логической верности и подкреплённости найденными фактами.
  • С помощью PRM строится дерево вариантов шага (value tree search), из которого формируются пары «верный шаг, ошибочный шаг» для дообучения политики методом пошаговой DPO (прямой оптимизации предпочтений).
  • На пяти бенчмарках с одно- и многошаговыми вопросами PRO-Step показал лучшую среднюю точность по EM и F1; код, модели и обучающие данные выложены в открытый доступ на GitHub.

Почему это важно

RAG-системы, стандартный способ снабдить языковую модель актуальными и проверяемыми фактами, но при многошаговых вопросах цепочка «нашёл, сделал вывод, нашёл ещё, сделал вывод» ломается уже на первом неверном шаге поиска, и весь ответ проваливается. Обучение только по итоговому ответу этого не видит и не может целенаправленно исправить именно такой тип ошибок. PRO-Step решает эту проблему: даёт модели сигнал на каждом шаге отдельно, причём двойной, правильно ли рассуждение и опирается ли оно на реально найденные факты, а не просто угадан ли в итоге правильный ответ.

Кому это важно

Разработчикам и исследователям, которые строят или дообучают RAG-системы для сложных многошаговых вопросов, ассистентов с поиском по документам, исследовательских агентов, систем вопрос-ответ над базами знаний, где ошибка на промежуточном шаге поиска обесценивает весь ответ.

Как это применить

Авторы выложили код, обученные модели и обучающие данные в открытый доступ на GitHub (репозиторий PRO-Step), так что метод можно воспроизвести или адаптировать под свою RAG-систему: обучить собственную модель вознаграждения процесса на своих данных и дообучить политику методом пошаговой DPO. Конкретных цифр по стоимости обучения или требованиям к вычислительным ресурсам в тексте не приведено.

Можно ли доверять

Это препринт на arXiv, результаты пока не прошли рецензирование в журнале или на конференции. В тексте аннотации не названы ни авторы, ни организация, ни конкретные бенчмарки, ни числовые показатели EM/F1, заявлено лишь, что PRO-Step лучше сравниваемых методов «в среднем» на пяти бенчмарках, без указания величины отрыва. Доверие подкрепляет то, что код, модели и данные открыты и работу можно проверить самостоятельно.

Риски и подводные камни

Метод устроен сложнее обычного дообучения: нужно отдельно обучить генеративную модель вознаграждения процесса, затем строить для неё дерево вариантов по каждому шагу, и только потом дообучать саму модель-политику методом DPO, это заметно больше вычислительных затрат и инженерной работы, чем обучение по итоговому ответу. Поскольку в аннотации не названы ни сравниваемые методы, ни точные цифры прироста, оценить реальный масштаб улучшения по описанию работы нельзя, нужно смотреть полный текст статьи.