Terminal-Bench: почти 40% «нерешаемых» задач бенчмарка ИИ-агентов оказались просто сломаны

Исследователи изучили замороженную производственную базу бенчмарков Terminal-Bench 3 и Frontier-Bench 0.1: 1081 pull request, 639 оценённых задач, 28 801 попытка прохождения и 105 933 доллара потраченных на агентов средств. Центральный вопрос работы, что на самом деле доказывает задача с нулевым процентом прохождения (all-fail): реальную неспособность моделей её решить или технический дефект самой задачи.

Авторы отобрали 125 задач, которые не прошёл честно ни один агент, и прогнали их через упорядоченный «фильтр валидности»: сверили артефакты задач, прогнали эталонные решения, пустые (заведомо неверные) решения-контроли, состязательные попытки, траектории агентов, телеметрию и записи ревью. Результат: лишь 78 из 125 задач пережили проверку и остались кандидатами в статус «подтверждённо нерешённых». Остальные 47 задач (около 38%) оказались проблемными: у 14 сломан эталонный проверочный механизм (oracle), в 8 доминируют сбои инфраструктуры, 4 задачи проходимы только через обход системы проверки (верификатора), а по 21 задаче имеющихся данных недостаточно, чтобы вообще подтвердить её решаемость.

Авторы подчёркивают, что отсутствие насыщения (то есть того, что ни одна модель не справилась), это не то же самое, что подлинная сложность задачи. При этом даже статус «подтверждённо нерешённая» узок по смыслу: он означает лишь, что авторский маршрут решения прошёл проверку, инфраструктура не была основной причиной провала, явного обхода верификатора не зафиксировано и все проверенные агенты не справились. Это не доказывает ни внутреннюю сложность задачи, ни полноту системы проверки, ни то, что модели действительно не справились именно с той способностью, которую задача должна была проверять. Дополнительно авторы разобрали отклонённые заявки на задачи и прошедшие задачи и показали, что сам по себе процент прохождения не объясняет, почему задача трудна. Вывод работы: перед тем как использовать нерешённые задачи как доказательство пределов возможностей моделей, разработчики фронтирных бенчмарков должны публиковать доказательную базу за каждой такой задачей.

Ключевые факты

  • Изучена база из 1081 pull request, 639 задач и 28 801 попытки прохождения в бенчмарках Terminal-Bench 3 / Frontier-Bench 0.1, на агентов потрачено 105 933 доллара
  • Из 125 задач с нулевым процентом прохождения (all-fail) только 78 прошли проверку валидности и остались кандидатами на статус «подтверждённо нерешённых»
  • У 14 задач сломан эталонный механизм проверки, у 8 доминируют инфраструктурные сбои, 4 проходимы только через обход верификатора, у 21 решаемость не подтверждена имеющимися данными
  • Даже статус «подтверждённо нерешённая» не доказывает ни внутреннюю сложность задачи, ни то, что модель провалилась именно из-за нехватки нужной способности
  • Авторы призывают бенчмарки публиковать доказательную базу за нерешёнными задачами, прежде чем использовать их как доказательство пределов моделей

Почему это важно

Фронтирные бенчмарки вроде Terminal-Bench используются как мерило прогресса ИИ-агентов, и задачи, которые не решает ни одна модель, часто подаются как доказательство пределов их возможностей. Работа показывает, что почти 40% таких «нерешаемых» задач на деле сломаны технически, из-за неверного эталонного решения, сбоев инфраструктуры или обходимой системы проверки, а не потому что задача действительно за гранью возможностей моделей.

Кому это важно

Разработчикам и составителям бенчмарков для ИИ-агентов, исследователям, которые ссылаются на такие тесты в оценке возможностей моделей, и компаниям, принимающим решения на основе заявлений о «пределах» текущих моделей.

Как это применить

Авторы предлагают конкретную процедуру: прежде чем объявлять задачу нерешаемой моделями, прогонять её через упорядоченный фильтр, проверку эталонного решения, контроль на пустых/заведомо неверных решениях, состязательные попытки обойти проверку и анализ телеметрии и инфраструктурных сбоев. Только после этого задачу можно относить к статусу «подтверждённо нерешённой», и даже тогда стоит публиковать доказательную базу за этим статусом.

Можно ли доверять

Работа основана на реальных производственных данных конкретного бенчмарка (более тысячи pull request и почти 29 тысяч попыток прохождения), с подробной методологией проверки. Материал опубликован как препринт на arXiv; в доступном тексте не указаны имена авторов, их принадлежность к организациям и дата публикации, а также не названы конкретные модели, выступавшие агентами в тестах.

Риски и подводные камни

Сами авторы предупреждают: даже прошедшая все проверки задача со статусом «подтверждённо нерешённая» не доказывает ни её внутреннюю сложность, ни полноту системы проверки, ни то, что модель провалилась именно из-за отсутствия проверяемой способности, а не по другой причине. Кроме того, в тексте не раскрыт механизм, каким образом верификатор можно обойти, что ограничивает практическую применимость этой части выводов.

«Тот же нулевой процент прохождения может быть вызван реальным разрывом в возможностях модели, но также, отсутствием контекста, сломанным эталонным решением, сбоем инфраструктуры или обходимой системой проверки.»

— авторы исследования