Thinkingbox: ИИ-агенты решают бизнес-задачи с первой попытки лишь в 65% случаев

Исследователи представили Thinkingbox, песочницу для проверки ИИ-агентов во взаимодействии «инструмент, агент, пользователь». Она даёт изолированные сессии инструментов, совместимые с протоколом MCP (Model Context Protocol, стандартный способ подключать внешние инструменты к ИИ-агентам), полные трассы выполнения задачи и оценку результата по итоговому состоянию серверной части системы (backend), а не только по тексту финального ответа.
На основе песочницы построен бенчмарк Thinkingbox-bench: 507 сценариев, привязанных к конкретным политикам компании, из пяти доменов, розничная торговля, гостиничный бизнес, автострахование, внутренняя IT-поддержка необанка и консалтинговая IT/HR-поддержка. Каждую попытку агента проверяют исполняемые тесты, специфичные для задачи: они принимают только верную последовательность действий и отклоняют попытки с неправильными, отсутствующими или лишними эффектами в системе; часть задач дополнительно проверяет содержание финального ответа агента.
Проверка моделей, как закрытых коммерческих, так и открытых, показала: лучшая из них справляется с задачей с первой попытки (pass@1) в 65,36% случаев. Но по более строгой метрике pass^20, которая проверяет стабильность решения при повторных попытках, результат той же модели падает до 25,25%, почти в 2,6 раза. Авторы также отмечают, что многие неудачные попытки заканчивались формально «чисто»: агент корректно завершал сессию и совершал валидные действия, меняющие состояние системы, но сама бизнес-задача при этом не была решена. Это значит, что сигналы уровня ответа или вызова инструмента сами по себе не показывают, выполнена ли задача до конца. Вывод авторов: между тем, что агент иногда находит успешную траекторию, и тем, что он надёжно доводит до конца многошаговую бизнес-задачу, меняющую состояние системы, большой разрыв. Песочница и бенчмарк выложены в открытом доступе на GitHub (microsoft/thinkingbox).
Ключевые факты
- Thinkingbox, песочница для ИИ-агентов с изолированными сессиями инструментов по протоколу MCP, полными трассами выполнения и оценкой по итоговому состоянию бэкенда, а не по тексту ответа.
- Thinkingbox-bench, 507 сценариев из пяти доменов: розничная торговля, гостиничный бизнес, автострахование, внутренняя IT-поддержка необанка, консалтинговая IT/HR-поддержка.
- Лучшая проверенная модель решает задачу с первой попытки (pass@1) в 65,36% случаев, но по строгой метрике повторяемости pass^20, лишь в 25,25%, почти в 2,6 раза меньше.
- Многие неудачные попытки завершались формально чисто и с валидными действиями, меняющими состояние системы, то есть по внешним сигналам нельзя судить, решена ли задача на самом деле.
- Песочница и бенчмарк выложены в открытом доступе на GitHub (microsoft/thinkingbox).
Почему это важно
Большинство существующих бенчмарков для ИИ-агентов проверяют разовый успех: починили код, прошли по сайту, вызвали нужный API. Но настоящая бизнес-работа требует другого, агенту нужно за несколько ходов собрать недостающую информацию, соблюдать внутренние политики компании, согласованно использовать несколько инструментов и в итоге привести систему в правильное конечное состояние, не оставив побочных эффектов. Thinkingbox создан именно для проверки этой более сложной и более реалистичной задачи, надёжного завершения многошагового процесса, а не единичного правильного ответа.
Кому это важно
Тем, кто строит или внедряет ИИ-агентов для реальных операционных процессов, а не только для чат-ответов: сценарии бенчмарка, розничная торговля, гостиничный бизнес, автострахование, внутренняя IT-поддержка необанка и консалтинговая IT/HR-поддержка. Для команд в этих и похожих областях результат бенчмарка, прямое предупреждение: даже лучшая проверенная модель ненадёжна при многократном повторении одной и той же задачи.
Как это применить
Thinkingbox даёт изолированные сессии инструментов по протоколу MCP, полные трассы выполнения и оценку по итоговому состоянию бэкенда системы. Поверх песочницы построен Thinkingbox-bench, 507 сценариев из пяти доменов, каждый проверяется исполняемым тестом, который принимает только верные траектории и отклоняет попытки с неправильными, отсутствующими или лишними эффектами; часть задач дополнительно проверяет содержание финального ответа. Оба инструмента выложены в открытом доступе на GitHub (microsoft/thinkingbox), так что команды могут прогнать собственных агентов через тот же набор сценариев.
Можно ли доверять
Цифры, из собственной публикации авторов, независимой проверки в источнике нет. В тексте не названы ни авторы по именам, ни конкретные модели, которые показали 65,36% pass@1 и 25,25% pass^20, ни подробности того, как устроены исполняемые тесты, помимо общей формулировки «специфичные для задачи». Это не повод отбрасывать результат, но повод воспринимать его как заявление разработчиков одного бенчмарка, а не как независимо подтверждённый факт об индустрии агентов в целом.
Риски и подводные камни
Главный риск, который показывает бенчмарк, методологический, а не разовая уязвимость: многие неудачные попытки агента выглядят полностью благополучно, сессия завершается чисто, действия, меняющие состояние системы, валидны, но сама бизнес-задача при этом не решена. Значит, мониторинг агентов по внешним сигналам (успешный ответ, отсутствие ошибок вызова инструмента) не гарантирует, что задача реально выполнена. Второй риск, разрыв между разовым и повторяемым успехом: падение с 65,36% до 25,25% при повторных попытках означает, что даже лучшая модель проваливает многие задачи, если требовать стабильности, а не единичной удачи.