Исследователи предложили R2VC, модульную архитектуру ИИ для проверки фактов с указанием источников

Языковые модели всё чаще используют для автоматической проверки фактов, но обычный способ, единый сквозной запрос к модели, который сразу отвечает и за поиск источников, и за рассуждение, и за оценку собственной уверенности, смешивает эти задачи в одну. Из-за этого трудно понять, на каком именно шаге система ошиблась, и трудно доверять её же оценке уверенности в ответе. Авторы работы предлагают R2VC (Retrieve, Reason, Verify, Calibrate, «найти», «рассудить», «проверить», «откалибровать»), архитектуру, которая разбивает проверку факта на четыре последовательных этапа, опирается на явно найденные источники, указывает их и умеет отказаться от ответа, если не уверена в нём.

Устроен R2VC так. На этапе поиска система ищет свидетельства в Википедии гибридным способом, сочетая разреженный поиск по ключевым словам и плотный поиск по смысловым векторным представлениям. Дальше генератор, дообученный с учителем и дополнительно выровненный методом DPO (Direct Preference Optimization, оптимизация модели под пары «предпочтительный/непредпочтительный» ответ), выдаёт не один, а несколько разных структурированных кандидатов вердикта. Из них выбирает внешний кросс-энкодер NLI (natural language inference, модель, определяющая, подтверждает ли один текст другой, противоречит ему или не связан с ним): он сопоставляет каждого кандидата с найденными источниками и выбирает вердикт, который они подтверждают лучше всего. Наконец, лёгкий калибратор уровня всей последовательности оценивает, насколько можно доверять получившемуся вердикту, и позволяет системе воздержаться от ответа, если уверенности недостаточно. Устроен калибратор как логистическая регрессия, обученная на отложенных 10 000 примерах датасета VitaminC, по признакам вроде средней лог-вероятности сгенерированных токенов, оценки верификатора, доли кандидатов с тем же вердиктом и числа использованных фрагментов-свидетельств; вердикт система выдаёт, только если калиброванная уверенность не ниже 0,60, а оценка верификатора, не ниже 0,55, иначе отвечает, что не уверена.

На бенчмарке FEVER, тесте для автоматической проверки фактов, связка из опорной модели на 8 млрд параметров и R2VC показала точность на 13,74% выше базового варианта. Та же модель без R2VC (в таблицах авторов, NLI-only Baseline) отдельно показывает точность 74,54% на FEVER против 84,71% у полного R2VC.

Абляционные эксперименты (тесты, в которых поочерёдно отключают часть системы, чтобы измерить её вклад в общий результат) показывают, что решающий вклад в качество вносят именно отбор кандидатов вердикта через NLI-модуль и калибровка уверенности. Если убрать отбор кандидатов, точность на FEVER падает до 76,24%. Если убрать калибровку, метрика Брайера (Brier score, показатель того, насколько предсказанная моделью уверенность соответствует её реальной правоте; чем она ниже, тем лучше откалибрована модель) почти удваивается, до 0,161.

Отдельно авторы вручную разобрали 250 ошибок системы и обнаружили, что главным узким местом остаётся именно поиск источников, особенно случаи, когда система находит свидетельства не о том объекте (сущности), о котором идёт речь в проверяемом утверждении. Вывод авторов: модульные пайплайны такого рода, с разделением поиска, рассуждения, проверки и калибровки на отдельные этапы, способны существенно повысить и точность, и надёжность оценки уверенности при открытой проверке фактов (то есть проверке по широкой базе знаний вроде Википедии, а не по узкому заранее заданному набору документов).

В доступном тексте не указана площадка, где вышла работа; ничего не сказано о том, будут ли выложены в открытый доступ код, веса модели или использованные данные.

Ключевые факты

  • R2VC, архитектура для автоматической проверки фактов из четырёх последовательных этапов (Retrieve, Reason, Verify, Calibrate): гибридный поиск источников по Википедии (по ключевым словам и по векторным представлениям), генератор с дообучением и DPO-выравниванием, который выдаёт несколько кандидатов вердикта, внешний кросс-энкодер NLI для отбора кандидата по найденным источникам и лёгкий калибратор для оценки уверенности и отказа от ответа.
  • На тесте FEVER связка из опорной модели на 8 млрд параметров и R2VC показала точность на 13,74% выше базового варианта; та же модель без R2VC (NLI-only Baseline) отдельно показывает 74,54% на FEVER против 84,71% у полного R2VC.
  • Абляционные эксперименты: наибольший вклад в качество вносят отбор кандидатов вердикта через NLI-модуль и калибровка уверенности. Без отбора кандидатов точность на FEVER падает до 76,24%; без калибровки метрика Брайера почти удваивается, до 0,161.
  • Ручной разбор 250 ошибок системы показал, что главным узким местом остаётся поиск источников, особенно случаи, когда найденные свидетельства относятся не к тому объекту, о котором идёт речь в проверяемом утверждении.
  • Это препринт на arXiv: в тексте не названа площадка публикации, и ничего не сказано о публикации кода, весов модели или данных.

Почему это важно

Языковые модели всё активнее применяют для автоматической проверки фактов, но обычный способ, единый сквозной запрос, который одновременно ищет источники, рассуждает и оценивает свою же уверенность, смешивает эти задачи так, что при ошибке трудно понять, на каком этапе она возникла, и трудно доверять итоговой уверенности модели в ответе. R2VC решает это разделением проверки факта на четыре последовательных этапа, поиск источников, генерация нескольких кандидатов вердикта, их отбор через отдельный модуль и калибровка уверенности с возможностью отказаться от ответа. Результат такого разделения измерим: на тесте FEVER точность связки из опорной модели на 8 млрд параметров и R2VC на 13,74% выше базового варианта, а абляционные эксперименты показывают, что наибольший прирост дают именно отбор кандидатов вердикта и калибровка уверенности.

Кому это важно

Командам, которые строят собственные системы автоматической проверки фактов, модерации контента или борьбы с дезинформацией поверх языковых моделей, R2VC даёт конкретную архитектуру, которая указывает источники вместо непрозрачного ответа «правда/ложь». Исследователям в области RAG (retrieval-augmented generation, генерация с опорой на найденные источники) и калибровки уверенности моделей: абляционные эксперименты авторов показывают, что среди компонентов архитектуры наибольший вклад в итоговое качество вносят именно отбор кандидатов вердикта через отдельный NLI-модуль и калибровка уверенности. И тем, кто выбирает между одним сквозным запросом к модели и модульным пайплайном для задач, где важна не только точность ответа, но и то, можно ли доверять уверенности системы и понять, на какие источники она опирается.

Как это применить

Перед нами аннотация научной работы, а не готовый инструмент или библиотека: в тексте не сказано, публикуют ли авторы код, веса модели или использованные данные, так что напрямую воспроизвести R2VC по одной аннотации нельзя. Но сама архитектура описана как последовательность конкретных шагов, которую можно взять за образец: гибридный поиск источников (по ключевым словам и по векторным представлениям одновременно) поверх собственной базы знаний; генератор, который выдаёт не один, а несколько кандидатов ответа; отдельная модель для сопоставления каждого кандидата с найденными источниками и выбора наиболее подтверждённого; и отдельный лёгкий калибратор поверх всего этого, для оценки уверенности и права системы промолчать вместо ответа наугад. Для точной реализации, включая сам расчёт уверенности калибратором, нужен полный текст статьи, а не только аннотация.

Можно ли доверять

Источник, препринт на arXiv: работа опубликована исследователями напрямую; текст не называет ни площадку, ни исход рецензирования. Все цифры, 13,74% относительного прироста точности, 76,24% и 0,161 в абляционных тестах, 250 разобранных вручную ошибок, это собственные измерения авторов на их собственной экспериментальной установке, без независимой проверки.

Риски и подводные камни

Даже с R2VC собственный ручной разбор авторов показывает, что поиск источников остаётся главным узким местом, особенно когда система находит свидетельства не о том объекте, о котором идёт речь в проверяемом утверждении: значит, дальнейшее улучшение, скорее всего, требует работы именно над поиском, а не только над проверкой кандидатов или калибровкой. Четыре последовательных этапа, поиск, генерация нескольких кандидатов, их отбор отдельной моделью и калибровка, обычно требуют больше вычислений на один ответ, чем единый прямой запрос к модели: по данным статьи, полный проход с шестнадцатью кандидатами даёт 84,71% точности за 20,31 секунды на утверждение против 78,10% за 1,49 секунды при одном кандидате. Результаты показаны на нескольких бенчмарках, FEVER и VitaminC, которые построены на Википедии и на английском языке; насколько архитектура переносится на другие языки, предметные области или источники знаний, доступная аннотация не позволяет судить.