AutoResearchEval: диагностика показала 45 типовых сбоев ИИ-агентов в научной работе

Исследователи представили AutoResearchEval, бенчмарк из 100 задач, основанных на реальных передовых научных работах и охватывающих 7 научных областей и весь цикл исследования: от постановки гипотезы и поиска источников до анализа данных, написания текста и рецензирования. На этом бенчмарке протестировали 8 комбинаций «агентный каркас + модель», получив в сумме 800 траекторий работы агентов с пометками на уровне отдельных шагов процесса, а не только итогового результата.
На основе этих данных авторы построили AutoResearch Failure Taxonomy (ARFT), таксономию из 45 эмпирически выявленных паттернов сбоев. Для разметки такого объёма материала использовался откалиброванный по человеческим оценкам конвейер «агент-судья», который разбирал полные траектории и промежуточные артефакты работы агентов.
Главный вывод: все выявленные паттерны сбоев сводятся к одному общему ограничению, у нынешних агентов нет метакогнитивного цикла. Это способность сверять то, что агент произвёл, с тем, что он реально нашёл, пересматривать вывод, если он не подтверждается, и задаваться вопросом, был ли вообще выбранный путь верным. Одни и те же паттерны сбоев повторяются во всех 8 протестированных комбинациях каркаса и модели, включая самые сильные модели из тестов, это указывает, что дефицит находится на уровне самой модели, а не конкретной архитектуры оркестрации вокруг неё. Авторы отдельно оговаривают: способны ли доработки на уровне оркестрации закрыть этот пробел, открытый вопрос, который эта работа не проверяла. Бенчмарк AutoResearchEval и таксономия ARFT опубликованы в открытом доступе для дальнейших исследований в области автономных научных открытий.
Ключевые факты
- AutoResearchEval, 100 задач по реальным передовым научным работам в 7 научных областях, охватывающих весь цикл исследования
- 8 комбинаций «агентный каркас + модель» дали 800 траекторий работы агентов с пометками на уровне процесса
- На их основе построена таксономия ARFT из 45 эмпирических паттернов сбоев, размеченных конвейером «агент-судья»
- Все паттерны сводятся к одному дефициту: у агентов нет метакогнитивного цикла, проверки результата против найденного и пересмотра решений
- Проблема повторяется во всех 8 комбинациях, включая сильнейшие модели, дефицит на уровне модели, а не оркестрации; работа не проверяла, лечится ли это доработками оркестрации
Почему это важно
Существующие оценки ИИ-агентов в основном мерили итоговый результат, но не показывали, как именно агент пришёл к ошибке и на каком шаге сломался процесс. AutoResearchEval закрывает этот пробел: 100 задач по реальным научным работам, полный цикл исследования и разметка не только результата, но и всей траектории с промежуточными артефактами. Это даёт первую системную картину того, где именно ИИ-агенты дают сбой при самостоятельной научной работе.
Кому это важно
Разработчикам агентных систем и научных ИИ-инструментов, таксономия ARFT даёт конкретный список из 45 паттернов сбоев, по которому можно проверять собственные агентные каркасы. Исследователям в области автономных научных открытий, бенчмарк и таксономия опубликованы в открытом доступе для дальнейшей работы. Тем, кто планирует полагаться на ИИ-агентов в реальных исследовательских задачах, полезно знать: даже сильнейшие протестированные модели показывают те же провалы.
Как это применить
AutoResearchEval и ARFT выложены в открытый доступ, их можно использовать как готовый набор задач и словарь ошибок для диагностики собственных агентных систем на этапах постановки гипотезы, поиска, анализа, написания и рецензирования. Поскольку дефицит локализован на уровне модели, а не конкретного каркаса, специфика источника не даёт готового рецепта на уровне оркестрации, авторы прямо пишут, что это отдельный открытый вопрос.
Можно ли доверять
Источник, научная публикация с методологией: 100 задач по реальным опубликованным работам, 8 комбинаций каркас-модель, 800 траекторий, разметка калиброванным по человеческим оценкам конвейером «агент-судья». В доступном тексте не названы конкретные модели и агентные каркасы, участвовавшие в оценке, не перечислены 7 научных областей и не дана разбивка 45 паттернов по категориям и частоте, это ограничивает возможность независимо оценить детали без обращения к полному тексту работы.
Риски и подводные камни
Главный риск описан самими авторами: неясно, устраняется ли обнаруженный дефицит доработками на уровне оркестрации (менеджмент задач, дополнительные проверочные шаги), работа этот вопрос не проверяла. Отсутствие метакогнитивного цикла означает, что агент не замечает собственных ошибок и не пересматривает избранный путь, а значит в реальных научных задачах его выводы требуют проверки человеком, а не слепого доверия.