FARS обошла конкурентов больше чем вдвое по оценкам Gemini и Claude в первом бенчмарке автономных ИИ-исследователей

Учёные предложили и опробовали протокол автоматизированного рецензирования для сравнения систем «ИИ-учёный», программ, которые самостоятельно проводят исследование и пишут научную статью. Проблема, которую решает работа: качество таких сгенерированных статей раньше никто количественно не сравнивал.

В качестве судей взяли три независимые языковые модели, GPT-5.4, Gemini и Claude, которые оценивали каждую статью по четырём критериям: оригинальность, научная строгость, ясность изложения и значимость результатов, по шкале от 1 до 5. Четырём конкурирующим фреймворкам, Sakana AI (в двух версиях, v1 и v2), CycleResearcher и Data-to-Paper, дали одни и те же 15 исследовательских предложений, изначально опубликованных коммерческой компанией FARS, которая сама занимается автономными ИИ-исследованиями. Так получили 60 статей. Их сравнили с 15 собственными эталонными статьями FARS, написанными по тем же предложениям.

Результат: эталонные статьи FARS получили среднюю оценку 2,14, 2,47 балла, а статьи четырёх конкурирующих систем, заметно меньше, 1,00, 1,87 балла. По оценкам Gemini и Claude отрыв FARS от ближайшего конкурента превысил двукратный.

Отдельно авторы проверили, насколько согласованы между собой сами модели-рецензенты. Оценки Gemini и Claude совпадают очень сильно (ρ = 0,907, p < 0,001), и обе они почти идеально коррелируют со сводной (синтезированной) оценкой (ρ = 0,961, p < 0,001), это подтверждает, что автоматическое рецензирование даёт устойчивый результат. А вот GPT-5.4 согласуется с двумя другими моделями заметно слабее (ρ ≈ 0,32): по мнению авторов, это означает, что модель судит по другим критериям, а не то, что она ошибается.

Авторы называют это первым количественным бенчмарком для систем автономных ИИ-исследователей и делают вывод, что оценка несколькими моделями-рецензентами одновременно даёт масштабируемый и последовательный способ измерять качество автономных исследований.

Ключевые факты

  • Впервые количественно сравнили несколько систем «ИИ-учёный»: Sakana AI (v1 и v2), CycleResearcher и Data-to-Paper против коммерческого сервиса FARS
  • Все системы получили одинаковые 15 исследовательских предложений от FARS; конкуренты сгенерировали 60 статей, которые сравнили с 15 эталонными статьями самой FARS
  • Три модели-рецензента (GPT-5.4, Gemini, Claude) оценивали статьи по шкале от 1 до 5 по четырём критериям, оригинальность, строгость, ясность и значимость
  • Статьи FARS набрали 2,14, 2,47 балла против 1,00, 1,87 у конкурентов, по оценкам Gemini и Claude разрыв больше чем двукратный
  • Gemini и Claude сильно согласны друг с другом (ρ = 0,907) и с итоговой оценкой (ρ = 0,961), а GPT-5.4 расходится с ними заметно сильнее (ρ ≈ 0,32)

Почему это важно

Системы, которые самостоятельно проводят научные исследования и пишут статьи, могли в перспективе ускорить науку, но у индустрии не было стандартного способа сравнить их между собой по качеству. Эта работа предлагает первый такой протокол: три независимые языковые модели выступают рецензентами и оценивают статьи по тем же критериям, что используют настоящие научные журналы.

Кому это важно

Разработчикам платформ автономных исследований, компаниям и инвесторам, которые оценивают такие сервисы вроде FARS, а также всем, кто применяет языковые модели как рецензентов или судей для другого контента: работа показывает, когда такому судейству можно доверять, а когда нет.

Как это применить

Сам протокол, три независимых модели-рецензента плюс проверка их согласованности через корреляцию, можно переиспользовать как воспроизводимый способ сравнивать будущие системы генерации статей. Отдельный практический вывод: полагаться на оценку одной модели рискованно, лучше сверять несколько моделей между собой, как в этой работе.

Можно ли доверять

Сильная сторона протокола, высокая согласованность Gemini и Claude друг с другом и с итоговой оценкой, это подтверждает устойчивость метода. Но есть повод для осторожности: GPT-5.4 оценивает статьи заметно иначе, чем два других рецензента, и остаётся неясным, какая из моделей права. Ещё один момент, который источник не проясняет: исследовательские предложения и сами эталонные статьи-победители дала одна и та же компания FARS, та, чей результат в итоге оказался лучшим; была ли проверка слепой и кто именно проводил бенчмарк, в тексте не указано.

Риски и подводные камни

Выборка небольшая, всего 15 предложений и в сумме 75 статей на четыре системы плюс эталон. Источник не приводит разбивку оценок по каждой из четырёх систем отдельно (кто из Sakana AI v1, Sakana AI v2, CycleResearcher и Data-to-Paper оказался слабее или сильнее, неизвестно), не называет стоимость и вычислительные затраты запуска каждой системы. И сама идея оценивать статьи, написанные языковыми моделями, с помощью других языковых моделей несёт риск: судьи могут награждать стиль, который им «нравится», а не объективно более сильную науку.