Риторика статьи «взламывает» оценку ИИ-рецензентов ICLR

Большие языковые модели всё чаще участвуют в научной экспертизе, выступают в роли рецензентов статей. Авторы работы проверили потенциальную форму reward hacking (эксплуатации системы оценки): меняется ли вердикт ИИ-рецензента, если менять только риторическую подачу текста, оставляя научное содержание неизменным.
Для этого исследователи собрали контролируемый корпус из 4200 полных рукописей, созданных на основе 120 обезличенных заявок на конференцию ICLR 2026. Две модели-переписчика переработали в каждой рукописи шесть риторических параметров, задавая для них противоположные (усиленный и ослабленный) варианты подачи. Затем пять моделей-рецензентов оценили получившиеся рукописи по двум протоколам, обычному и строгому. Отдельно проверили три схемы переписывания: совместную (правка нескольких параметров сразу), рекурсивную (повторные проходы) и управляемую рецензентом (переписывание с учётом его отзыва).
Главный результат: чувствительность к риторике оказалась не равномерной, а структурированной. Наибольший разрыв между «усиленным» и «ослабленным» вариантом итоговой оценки дают параметры «фрейминг доказательств» и «позиция по новизне работы»; заметно слабее, но тоже устойчиво, работает «фрейминг охвата»; у остальных параметров эффект меньше и менее стабилен. Эта иерархия сохраняется на выборках рукописей разного качества, оценённого людьми.
При этом сдвиг оценки сильно зависит от того, какой балл ИИ-рецензент дал рукописи изначально: низкие оценки при более выигрышной риторике склонны расти, высокие, падать, а самые чёткие направленные сдвиги видны у рукописей со средним исходным баллом.
Более сложные схемы переписывания не дают надёжно большего выигрыша. Эффект совместного переписывания сильно зависит от того, какая именно модель переписывала текст; переписывание с учётом отзыва рецензента не превосходит стабильно обычный второй проход без подсказок; повторное переписывание даёт убывающую отдачу, зависящую от конкретной настройки эксперимента. В целом по всем условиям: то, какая модель переписывает текст, определяет в основном то, насколько далеко расходятся «усиленный» и «ослабленный» варианты; то, какая модель рецензирует, определяет величину и знак итогового сдвига оценки.
Строгий протокол проверки в среднем снижает итоговую оценку на 1,36 балла по сравнению с обычным протоколом, но не меняет устойчиво саму чувствительность оценки к риторике.
Авторы делают вывод, что их результаты показывают, в каких именно случаях риторическая подача текста влияет на решение ИИ-рецензента, и указывают на необходимость систем оценки, устойчивых к вариациям подачи текста при сохранении содержания.
Ключевые факты
- Корпус для эксперимента: 4200 полных рукописей, полученных из 120 обезличенных заявок на ICLR 2026
- Две модели-переписчика меняли шесть риторических параметров текста в противоположных направлениях, пять моделей-рецензентов оценивали результат по обычному и строгому протоколам
- Сильнее всего на оценку влияют «фрейминг доказательств» и «позиция по новизне работы», слабее, «фрейминг охвата», у остальных параметров эффект нестабилен
- Сдвиг оценки зависит от исходного балла: низкие оценки под влиянием риторики растут, высокие падают, ярче всего эффект в середине шкалы
- Строгий протокол проверки снижает среднюю итоговую оценку на 1,36 балла, но не меняет чувствительность к риторике
Почему это важно
Языковые модели всё активнее выступают рецензентами научных работ, и от этого напрямую зависит, какие статьи допускаются к публикации. Исследование показывает конкретную форму reward hacking: итоговая оценка может определяться не столько сутью работы, сколько тем, как она риторически подана, а значит, доверие к автоматизированной экспертизе нельзя принимать как данность.
Кому это важно
Организаторам конференций и журналов, которые применяют или рассматривают применение ИИ-рецензентов; разработчикам таких систем оценки; авторам статей, чья публикация зависит от честности процесса; шире, всем, кто строит модели-судьи (LLM-as-judge) для оценки текста, не только в науке.
Как это применить
Тем, кто внедряет ИИ-рецензирование, стоит закладывать проверку системы на устойчивость к чисто риторическим вариациям текста при неизменном содержании, до запуска, а не после. Одно лишь ужесточение протокола проверки не решает задачу: строгий протокол в эксперименте снизил средние оценки, но не убрал саму чувствительность к риторике, значит нужны отдельные меры устойчивости.
Можно ли доверять
Это контролируемый эксперимент на крупном корпусе, 4200 рукописей, построенных на основе 120 реальных обезличенных заявок ICLR 2026, с двумя независимыми моделями-переписчиками и пятью моделями-рецензентами, проверенными в нескольких протоколах и схемах переписывания. При этом в доступном тексте не названы ни конкретные модели-переписчики и модели-рецензенты, ни авторы работы, поэтому судить о переносе выводов на конкретные коммерческие системы рецензирования по одному этому описанию рано.
Риски и подводные камни
Если подобные ИИ-рецензенты попадут в реальный процесс отбора статей без проверки на устойчивость, авторы смогут поднимать оценку риторической полировкой текста вместо улучшения самой работы, это и есть reward hacking на практике. Источник не раскрывает, как именно устроены совместная, рекурсивная и управляемая рецензентом схемы переписывания, поэтому часть выводов пока сложно проверить независимо.