Исследователи представили RubricReviewer, ИИ-рецензента статей с прозрачными критериями оценки

Рецензирование научных работ на крупных конференциях и в журналах захлёбывается под растущим потоком заявок, и организаторы всё чаще привлекают большие языковые модели (LLM) в помощь рецензентам. Но у существующих ИИ-рецензентов, по словам авторов работы, два структурных изъяна. Во-первых, они сразу превращают рукопись в готовую рецензию, не формулируя явно, по каким критериям судят: сами критерии остаются неявными и перемешанными с итоговым вердиктом. Во-вторых, два основных подхода закрывают лишь половину задачи хорошей рецензии каждый: системы без дообучения (training-free) собирают широкие доказательства по тексту статьи, но выдают критику без чёткого фокуса, а дообученные на человеческих оценках системы (training-based) наследуют вместе с человеческим суждением его шум и неровное покрытие тем.

Авторы предлагают RubricReviewer, фреймворк, полностью построенный вокруг явной рубрики критериев оценки. Формирование этой рубрики выделено в отдельный промежуточный шаг: и текст рецензии, и итоговая оценка строятся уже поверх рубрики, адаптированной под конкретную статью. Систему образуют два компонента: агент-разведчик Scout, который без дополнительного дообучения собирает внешние доказательства по статье, и модель Aligner, дообученная и выровненная под человеческие оценки, которая анализирует эти доказательства в свете рубрики и формирует итоговую рецензию. Так фреймворк объединяет сильные стороны обоих источников «обучения», широту training-free-подхода и точность человеческой разметки.

В экспериментах на реальных заявках RubricReviewer дал рецензии заметно более полные и более различающие (по качеству работ), чем у предыдущих систем, и показал наибольшую устойчивость к состязательным атакам с внедрением вредоносных инструкций в текст статьи (prompt injection) среди сравниваемых систем. Абляционные исследования подтвердили, что каждый из компонентов, явная рубрика, Scout и Aligner, необходим: без любого из них результат хуже. Авторы не приводят конкретных числовых показателей улучшения, не называют состав сравниваемых систем, не описывают выборку «реальных заявок» и не указывают ни имена авторов, ни площадку, где будет представлена работа.

Ключевые факты

  • Организаторы крупных конференций и журналов всё активнее привлекают LLM в помощь ревью, из-за роста числа заявок, опережающего число рецензентов.
  • У существующих ИИ-рецензентов критерии оценки остаются неявными и перемешанными с вердиктом, а системы без дообучения собирают широкие доказательства без фокуса, тогда как дообученные системы наследуют шум и неровное покрытие человеческой оценки.
  • RubricReviewer выносит формирование рубрики критериев в отдельный явный шаг, адаптированный под конкретную статью, и рецензия, и итоговая оценка строятся уже поверх неё.
  • Систему образуют два компонента: агент-разведчик Scout без дообучения, который собирает внешние доказательства, и обученная, выровненная под человеческие оценки модель Aligner, которая анализирует эти доказательства и формирует рецензию.
  • В экспериментах на реальных заявках RubricReviewer дал более полные и различающие рецензии, чем предыдущие системы, и показал наибольшую устойчивость к внедрению вредоносных инструкций в текст статьи; абляционные исследования подтвердили необходимость каждого компонента.

Почему это важно

Число заявок на крупные конференции и в журналы растёт быстрее, чем число рецензентов, поэтому организаторы всё чаще привлекают LLM в помощь рецензированию. Но у существующих ИИ-рецензентов, по словам авторов, два структурных изъяна: они сразу выносят вердикт по рукописи, не формулируя явно критерии, по которым судят, логика оценки остаётся «зашитой» внутри модели и необъяснимой; кроме того, системы без дообучения собирают широкие доказательства, но выдают критику без чёткого фокуса, а дообученные системы наследуют человеческую субъективность вместе с её шумом и неровным покрытием тем. RubricReviewer решает обе проблемы, сделав генерацию рубрики критериев отдельным явным шагом, от которого зависят и текст рецензии, и итоговая оценка.

Кому это важно

В первую очередь, организаторам крупных конференций и журналов, которые ищут способ справиться с перегрузкой рецензентов без потери качества оценки. Также, исследователям, которые получают рецензии от ИИ-инструментов: явная и объяснимая рубрика оценки делает такую обратную связь понятнее, чем вердикт «чёрного ящика». И, наконец, разработчикам собственных систем автоматического рецензирования, архитектура RubricReviewer (явная рубрика плюс связка «разведчик доказательств» и «выровненная под человека модель») задаёт шаблон, который можно переиспользовать.

Как это применить

RubricReviewer, исследовательский прототип, а не публичный сервис: авторы не называют ни площадку внедрения, ни доступность кода или демо. Практическая ценность пока в архитектуре, которую можно взять за образец: сначала модель строит рубрику критериев, адаптированную под конкретную статью, затем агент-разведчик Scout без дополнительного обучения собирает внешние доказательства, релевантные факты, сравнения, контекст, а обученная и выровненная под человеческие оценки модель Aligner анализирует эти доказательства в свете рубрики и формирует итоговую рецензию и оценку.

Можно ли доверять

Источник, препринт на arXiv, не прошедший рецензирование сторонним изданием; авторы, их аффилиации и площадка публикации в тексте не указаны. Заявления о превосходстве над предыдущими системами и устойчивости к атакам подкреплены экспериментами на «реальных заявках» и абляционными исследованиями, но конкретные числа, доли улучшения, размер выборки, состав сравниваемых систем, в доступном тексте не приведены. Масштаб выигрыша по фактуре не проверить, только общее направление результата, заявленное самими авторами.

Риски и подводные камни

Главный риск, доверить итоговую оценку научной работы связке моделей без публикации количественных результатов: без чисел трудно понять, насколько именно рецензии RubricReviewer лучше существующих систем и на какой выборке это проверено. Заявленная устойчивость к атакам с внедрением вредоносных инструкций в текст статьи обнадёживает, но такие защиты обычно проверяются против конкретного набора атак и не гарантируют устойчивости к новым, ещё не придуманным приёмам. Кроме того, обученный компонент Aligner наследует человеческую разметку, на которой обучался, а значит, вместе с её точностью может унаследовать и её предвзятости.