ASI-Bench: без помощи человека ИИ-агенты теряют почти половину результата

Исследователи представили ASI-Bench, бенчмарк для проверки способности ИИ-систем не просто применять уже известные знания, а вести настоящее научное исследование: искать новое и доводить идеи до проверяемого результата. Авторы отмечают, что существующие тесты в основном проверяют, может ли ИИ дать правильный ответ по выученным знаниям или выполнить задачу под подробным руководством человека, а не то, способен ли он исследовать самостоятельно.
ASI-Bench устроен по-другому: это первый бенчмарк, который одновременно оценивает способность ИИ к инновационному поиску и к самостоятельному проведению научной работы в разных областях, и первый, где методическая подсказка человека постепенно убирается в рамках одного и того же исследовательского проекта, чтобы проверить, как далеко ИИ продвинется сам. Бенчмарк построили более 40 экспертов, потративших свыше 31 000 человеко-часов. Он включает 60 исследовательских задач проектного уровня в 11 научных областях. Каждая задача проходит экспертную проверку, аудит с участием ИИ, выполнение в песочнице и валидацию системы оценки.
Авторы прогнали через ASI-Bench 18 конфигураций «агент + модель» на базе современных систем и меняли объём подсказки. При полном методическом руководстве средний балл составил 50,91. Когда агенту оставляли только указание метода, без дальнейших подсказок, балл упал до 29,10. А когда агент должен был сам выбрать метод исследования, средний балл составил 26,62, то есть почти вдвое ниже показателя с полным руководством. По словам авторов, этот резкий спад показывает: нынешние системы всё ещё сильно зависят от указаний человека и далеки от того, чтобы самостоятельно вести научное исследование целиком, от постановки задачи до проверяемого результата. Бенчмарк открыт: авторы приглашают исследователей присылать новые задачи через сайт проекта.
Ключевые факты
- ASI-Bench, первый бенчмарк, который в рамках одного и того же исследовательского проекта постепенно убирает методическую подсказку человека, проверяя, насколько далеко ИИ продвинется самостоятельно
- Над бенчмарком работали более 40 экспертов, потративших свыше 31 000 человеко-часов; он включает 60 исследовательских задач проектного уровня в 11 научных областях
- На 18 конфигурациях «агент + модель» средний балл упал с 50,91 (при полном руководстве человека) до 29,10 (когда задан только метод) и до 26,62 (когда агент сам выбирает метод), почти вдвое ниже начального уровня
- Каждая задача бенчмарка проходит экспертную проверку, ИИ-аудит, выполнение в песочнице и валидацию системы оценки
- Авторы делают ASI-Bench открытым и приглашают исследователей присылать новые задачи через сайт проекта
Почему это важно
Большинство существующих тестов проверяют, может ли ИИ дать верный ответ по уже выученным знаниям или выполнить задачу под подробным руководством человека. ASI-Bench впервые системно проверяет другое: способен ли ИИ вести исследование самостоятельно, когда подсказки постепенно убирают в рамках одного и того же проекта. Результат, не абстрактная метрика, а прямое измерение разрыва между «ИИ выполняет инструкции» и «ИИ ведёт исследование сам»: падение среднего балла с 50,91 до 26,62 при уходе от полного руководства к полной самостоятельности.
Кому это важно
Тем, кто разрабатывает и оценивает ИИ-агентов для научной и исследовательской работы: лабораториям, создающим модели и агентные системы, а также командам, которые пытаются понять, насколько ИИ-инструментам можно доверить самостоятельные этапы исследования без пошагового контроля человека.
Как это применить
ASI-Bench открыт: авторы приглашают исследователей и разработчиков присылать новые задачи через сайт проекта, чтобы расширять набор из 60 заданий и 11 научных областей. Команды, оценивающие агентные ИИ-системы, могут использовать методику постепенного снятия подсказки как ориентир: результат при полном руководстве человека мало говорит о готовности системы к самостоятельной работе, важен именно разрыв между этим результатом и результатом без подсказок.
Можно ли доверять
Методика проверки выглядит основательной: 60 задач проектного уровня в 11 научных областях, свыше 31 000 человеко-часов работы более 40 экспертов, а каждая задача проходит экспертную проверку, аудит с участием ИИ, выполнение в песочнице и отдельную валидацию системы оценки. В исходном тексте не раскрыты авторы и организация-разработчик, а также не приведена разбивка результатов по отдельным конфигурациям «агент + модель», эти детали остаются за рамками пересказанного текста.
Риски и подводные камни
Резкое падение среднего балла с 50,91 до 26,62 при снятии методической подсказки означает, что нынешние ИИ-системы, по словам авторов бенчмарка, всё ещё сильно зависят от человеческого руководства и далеки от способности самостоятельно провести исследование целиком, от постановки задачи до проверяемого результата. Это стоит учитывать при любых заявлениях о «полной автономности» исследовательских ИИ-агентов.