LitReview Arena: ИИ-агенты обыгрывают человека в обзорах литературы лишь в 23% случаев

Исследователи представили LitReview Arena, платформу для оценки ИИ-агентов, которые пишут обзоры научной литературы. Формат работы похож на поединок: эксперты в предметной области с опытом написания научных ИИ-текстов сравнивают два анонимных черновика обзора, один написан человеком, другой ИИ-агентом, и не знают, где какой. Экспертов подбирают под темы, в которых они разбираются, и просят оценить каждую пару черновиков по пяти специфичным для литературных обзоров критериям (среди них, структура текста и качество предлагаемых направлений дальнейших исследований).

Авторы собрали около 3 тысяч экспертных суждений, в каждом из которых, результат сразу по пяти критериям. Главный вывод: даже самые сильные из проверенных систем побеждают человеческие черновики лишь в 23,0% решительных (то есть не ничейных) поединков по общей полезности обзора. При этом агентные ИИ-системы, те, что самостоятельно ищут и обрабатывают источники, например Sonar Deep Research, превосходят обычные базовые языковые модели больше чем на 60%: агентность даёт системе заметное преимущество, даже если до уровня человека ей ещё далеко.

Отдельно авторы проверили, насколько хорошо существующие методы "ИИ в роли судьи" (когда одна модель оценивает тексты, написанные другими) совпадают с мнением людей-экспертов. Совпадение оказалось слабым, коэффициент корреляции Спирмена составил 0,467, особенно расходятся оценки по критериям, требующим синтеза материала, вроде структуры текста и предложений по дальнейшим исследованиям. На основе собранных экспертных суждений авторы откалибровали собственный оценщик LitJudge, который поднял согласованность с экспертами до коэффициента 0,78, это уже сравнимо с тем, насколько сами эксперты согласны друг с другом. Код и данные исследования выложены в открытый доступ на GitHub.

Ключевые факты

  • LitReview Arena, платформа-поединок: эксперты вслепую сравнивают обзоры литературы, написанные человеком и ИИ-агентом, по пяти критериям
  • Собрано около 3 тысяч экспертных суждений; даже сильнейшие ИИ-системы выигрывают у людей лишь в 23,0% решительных поединков по общей полезности
  • Агентные системы вроде Sonar Deep Research превосходят обычные базовые модели больше чем на 60%
  • Существующие методы "ИИ-судья" плохо совпадают с оценками экспертов (корреляция Спирмена 0,467), особенно на задачах, требующих синтеза
  • Авторы выпустили откалиброванный оценщик LitJudge с согласованностью 0,78 с экспертами и открыли код и данные на GitHub

Почему это важно

Обзоры научной литературы, важная часть исследовательской работы, и ИИ-агенты всё активнее берутся их писать. Но проверить, насколько такой автоматический обзор действительно хорош, сложно: метрики, которые просто сверяют пересечение ссылок с эталоном, не улавливают то, что реально важно для читателя-исследователя, качество синтеза материала, структуру, полезность выводов. Это требует именно экспертной оценки, а не автоматического подсчёта. LitReview Arena, попытка построить такую оценку системно, через прямое слепое сравнение с человеческими обзорами.

Кому это важно

Работа адресована исследователям, которые разрабатывают ИИ-инструменты для научной работы и обзоров литературы, а также тем, кто строит методики оценки качества текстов, сгенерированных ИИ. Полезна она и учёным, которые уже используют или планируют использовать ИИ-агентов для черновиков обзоров литературы в собственной работе, платформа даёт ориентир, насколько таким черновикам сейчас можно доверять.

Как это применить

Авторы выложили код и собранные данные в открытый доступ на GitHub. Разработчики ИИ-агентов для литературных обзоров могут использовать LitReview Arena как полигон для сравнения своих систем с человеческими черновиками и друг с другом. Оценщик LitJudge, откалиброванный на экспертных суждениях, можно применять как более надёжную замену обычным методам "ИИ-судья" там, где нужна автоматическая, но приближенная к экспертной оценка качества такого текста.

Можно ли доверять

Работа опирается на массив примерно в 3 тысячи экспертных суждений от специалистов с опытом написания научных ИИ-текстов, подобранных под темы по их компетенции, это методически более основательный подход, чем автоматические метрики совпадения ссылок. При этом текст пока распространяется как препринт на arXiv, то есть не прошёл рецензирование в журнале или на конференции; в источнике не названы ни авторы, ни их организации, ни то, какие именно системы вошли в число "сильнейших" с результатом 23,0%.

Риски и подводные камни

Главный результат исследования, не про то, что ИИ уже пишет обзоры литературы лучше людей, а ровно наоборот: даже лучшие проверенные системы проигрывают человеку в подавляющем большинстве решительных поединков. Кроме того, слабое совпадение (0,467) между стандартными методами "ИИ-судья" и мнением экспертов означает, что многие прежние оценки качества ИИ-обзоров, построенные на таких судьях, могли быть неточными. Даже собственный оценщик авторов, LitJudge, обучен на конкретном пуле экспертных суждений, насколько он обобщается на другие области науки и других экспертов, из доступного текста не следует.