ActReview: нейросеть научили писать дельные рецензии на научные статьи

ActReview: нейросеть научили писать дельные рецензии на научные статьи

Исследователи представили ActReview, обучающий подход для генерации «действенных» рецензий на научные статьи: таких, которые не просто указывают на слабое место, а подсказывают автору, что именно поправить. Авторы разбивают задачу на два подшага: сначала модель ставит диагноз, формулирует конкретную претензию к работе, затем предлагает план правки. Центральная идея работы в том, что ответы авторов на замечания рецензентов (rebuttal) на практике уже содержат готовые примеры того, как решается та или иная претензия, и это можно использовать как обучающий сигнал, не размечая данные вручную. Из реальных цепочек «рецензия, ответ автора» с площадки OpenReview команда собрала датасет ActReview-40K: замечания рецензентов сопоставлены с ответами авторов, а итоговые формулировки привязаны к конкретным местам в тексте статьи. На этом датасете дообучили модель Qwen3-8B-Base: сначала многозадачным дообучением с учителем (SFT), затем алгоритмом GRPO с наградами по рубрике, награда учитывает, насколько предложение соответствует конкретной претензии и подкреплено текстом статьи. Для проверки результата исследователи также собрали ActReview-Bench, бенчмарк из 1000 примеров с ручной разметкой, оценивающий и качество диагностики, и полезность предложенных правок. По итогам экспериментов ActReview превосходит прежние специализированные модели генерации рецензий по действенности советов и их привязке к тексту статьи и держится на уровне сильных языковых моделей, работающих через промпт. Оценка людьми подтвердила, что предложенные правки стали полезнее, но выявила сохраняющийся разрыв в технической точности рекомендаций. Дополнительные проверки показывают, что подход переносится на статьи, не входившие в обучение, и даёт устойчивые результаты при оценке разными независимыми судьями.

Ключевые факты

  • Задачу «действенной» рецензии разбили на два подшага: диагностика проблемы и предложение конкретной правки
  • Датасет ActReview-40K собран из реальных цепочек «рецензия, ответ автора» на OpenReview, без ручной разметки
  • Модель Qwen3-8B-Base дообучили сначала SFT, затем GRPO с наградами по рубрике за привязку правки к тексту статьи
  • Бенчмарк ActReview-Bench содержит 1000 размеченных вручную примеров для оценки диагностики и полезности правок
  • ActReview обходит специализированные модели по действенности советов, но люди-оценщики отметили разрыв в технической точности

Почему это важно

Языковые модели всё чаще используют для само-рецензирования статей перед подачей, но обычно они выдают общую критику без указания, что конкретно исправить. ActReview впервые превращает реальные споры авторов с рецензентами в источник обучающего сигнала для генерации именно действенных, привязанных к тексту советов, это отдельная, более прикладная постановка задачи, чем просто «покритиковать статью».

Кому это важно

Разработчикам инструментов для авторов научных работ и площадок вроде OpenReview, которые могут встроить такую предварительную проверку; исследователям в области автоматизации рецензирования, которым датасет ActReview-40K и бенчмарк ActReview-Bench дают готовую базу для сравнения новых подходов.

Как это применить

Подход построен на открытой модели Qwen3-8B-Base сравнительно небольшого размера (8 миллиардов параметров), что делает дообучение по этой схеме воспроизводимым без модели корпоративного масштаба; в источнике не указаны ни дата релиза, ни доступность кода или весов модели.

Можно ли доверять

Результаты проверены не только автоматическими метриками, но и оценкой людей на отдельном бенчмарке из 1000 примеров, а также проверкой устойчивости на статьях, не входивших в обучение, и согласия между разными независимыми судьями-оценщиками, это снижает риск того, что улучшение объясняется подгонкой под одну метрику.

Риски и подводные камни

Сами авторы отмечают, что при улучшении полезности советов сохраняется разрыв в их технической точности, то есть модель может предлагать правки, которые звучат конкретно и уместно, но не всегда технически верны. Конкретные цифры превосходства над другими моделями, авторы и организации, стоящие за работой, в источнике не приведены.