Microsoft и Hugging Face выпустили ThinkingBox: бенчмарк проверяет базу данных, а не ответ ИИ-агента

Microsoft и Hugging Face выпустили ThinkingBox: бенчмарк проверяет базу данных, а не ответ ИИ-агента

Microsoft и Hugging Face опубликовали совместный пост о ThinkingBox, песочнице для ИИ-агентов, и ThinkingBox-Bench, наборе задач для их оценки. Идея: агент может вести себя убедительно, делать корректные вызовы инструментов и вежливо отвечать клиенту, но оставить в базе данных неверное состояние. Поэтому бенчмарк оценивает не вызовы и не финальный ответ, а итоговое состояние бэкенда и побочные эффекты, которые агент после себя оставил.

Пример из поста (адаптирован из задачи бенчмарка, это иллюстрация). Клиентка пишет о кухонной технике за $745, застрявшей в курьерской «исключительной ситуации» на складе в Нашвилле через пятнадцать дней после ожидаемой даты доставки. Агент делает девять аккуратных вызовов инструментов: смотрит заказ и трекинг, профиль клиентки, дважды ищет политику возвратов, проверяет отсутствие тикета, создаёт его, фиксирует хронологию и верно читает политику: её сегмент аккаунта не даёт права на компенсацию за задержку. Затем агент закрывает тикет как решённый и отвечает: «Раз ваш запрос решён, могу ли я чем-нибудь ещё помочь?». Но ситуация с перевозчиком всё ещё открыта, и правильным итоговым состоянием был статус «на удержании до разрешения»; к тому же клиентка так и не получила реального ответа на свой вопрос. Проверка вызовов инструментов видела бы девять корректных вызовов, проверка факта записи в базу, тоже; расходится с реальностью только база. Единственная упавшая исполняемая проверка, поле статуса тикета: стоит «решён» вместо «на удержании».

Масштаб разрыва авторы оценивают так: в общем наборе из 121 680 валидных прогонов 12 моделей 79 853 попытки не прошли исполняемые проверки. Из этих провалов 67,24% завершились чисто, вызвали инструмент, меняющий состояние, и не сообщили о финальной ошибке инструмента. Проверки нашли в них неверные значения полей (77,61%), непредусмотренные лишние эффекты (43,30%) и отсутствующие обязательные эффекты (25,36%); эти находки пересекаются.

Вторая идея, надёжность. Каждая из 507 задач запускается 20 раз из одинакового чистого состояния, а отчётность включает pass@1 (оценка одной попытки), число задач, решённых хотя бы раз, и «наблюдаемое 20/20», буквальный счёт задач, пройденных во всех 20 попытках, без оценок и сглаживания.

Результаты по pass@1: Claude Opus 5.5 лидирует с 67,16%, на две трети пункта впереди Claude Opus 5 (66,50%). Kimi-K3, сильнейшая модель с открытыми весами, в пределах одного пункта от GPT-6-Astra. Разброс по доменам большой: Claude Opus 4.6 получает 68,62% в рознице, но 8,30% в автостраховании. В среднем по моделям из таблицы 2 розница даёт 59,52% pass@1, автострахование, 33,83%.

Сколько от одной попытки остаётся за 20 повторов: GPT-6 Astra сохраняет 78% своего показателя одной попытки, Claude Opus 5.5 и Claude Opus 5, по 71%, а GLM-5.1, Kimi-K2.6 и DeepSeek-V4-Pro, около 8%. Kimi-K3 решает хотя бы раз 93,89% бенчмарка (476 из 507 задач), и только 31 задачу не решает вовсе, меньше всех; в рознице у неё лучший pass@1, 82,24%. Но во всех 20 попытках она проходит лишь 68 задач из 507 (13,41%). У Claude Opus 5 наоборот: хотя бы раз решено 79,09% (106 задач не решены никогда), зато на каждой из 20 попыток пройдено 47,53% бенчмарка. Новая модель не лечит нестабильность: Opus 5.5 решает больше задач хотя бы раз, но во всех 20 попытках проходит столько же задач, сколько Opus 5, 241. Kimi-K3 решает хотя бы раз на 75 задач больше Opus 5, а Opus 5 стабильно решает на 173 задачи больше Kimi-K3. Вывод авторов: для работы с реальными записями колонка pass@20, не та, на которую стоит смотреть.

Стоимость. Авторы берут записанное потребление токенов из полной кампании 507 × 20 для каждой модели и оценивают его по полным (без скидок) прайсам OpenRouter+, исключая эндпоинты с заявленным квантованием. Стоимость успешной попытки = стоимость 507 попыток ÷ (507 × pass@1); это сравнительный индекс эффективности, а не счёт и не цена обслуживания одного производственного запроса. Пример: GPT-5.4, $43,49 за 507 попыток и 65,36% pass@1, то есть $0,131 за успешную попытку. На границе Парето (ни одна модель не дешевле и не точнее одновременно) три модели: GPT-5.6 Sol с минимальными $0,127 за успех; GPT-5.4, который добавляет 3,45 процентного пункта pass@1 за $0,004 сверху; Claude Opus 5.5, добавляющий ещё 1,80 пункта при $0,276 за успех. Claude Opus 5 ($0,475 за успех, 66,50%) дороже и хуже Opus 5.5 ($0,276, 67,16%).

Если оценивать надёжность, считается стоимость «надёжной задачи»: цена полной кампании из 20 прогонов ÷ число задач, пройденных 20 из 20. GPT-6-Astra: 20 × $86,03 = $1 720,60, 231 задача, итого $7,45 за надёжную задачу. Самый дешёвый, GPT-5.4 с $6,80, но только 128 задач проходят планку. GPT-6 Astra даёт 231 задачу за $7,45, Claude Opus 5.5, рекордные (наравне с Opus 5) 241 за $7,80. Opus 5 при тех же 241 стоит $13,30. GPT-5.6 Sol, самая дешёвая по одиночному успеху, выходит на $9,76 за надёжную задачу. Дешевле всего получить правильный ответ, не значит дешевле всего получить надёжный.

Сигнатуры сбоев. Каждой упавшей трассе присваивается одна детерминированная диагностическая сигнатура; главный итог, примерно четыре из пяти сбоев связаны с обращением с инструментами, а не с рассуждением (это невзвешенные средние долей по моделям и наблюдаемым меткам, а не единственные причинные объяснения; данные, абляция из таблицы 5 статьи). Агенты обычно доходят до попытки выполнить сценарий, но не умеют восстановиться после ошибок инструментов, невыполненных предусловий или пустых выборок, по словам авторов, это проблема повторов и обработки ошибок, а потом уже проблема модели.

Как устроено. ThinkingBox, песочница, ThinkingBox-Bench, датасет. Задача задаёт начальное состояние бэкенда, цель пользователя, доступные MCP-инструменты, политику домена и исполняемые проверки итогового состояния. Симулируемый пользователь хранит приватный контекст (номер бронирования, предпочтение, дату рождения) и выдаёт его только по запросу. Каждая попытка получает изолированную MCP-сессию со свежим состоянием, поэтому две попытки одной задачи не делят ни строки базы, ни кэша инструментов, только так сравнение по 20 прогонам осмысленно. В конце экстрактор побочных эффектов выясняет, что реально изменилось, а детерминированные судьи сверяют это с требуемым итогом: принимается любая траектория, дающая верный результат, и отбрасываются неверные, отсутствующие или лишние эффекты. Для требований без чистого значения в базе (например, «агент предупредил, что это не гарантировано?») используется узкий бинарный рубричный вопрос. Запуск бенчмарка через OpenEnv авторы выносят в отдельный раздел поста.

Ключевые факты

  • ThinkingBox-Bench, 507 состояний-зависимых бизнес-сценариев; каждый прогоняется 20 раз на модель, оценка идёт по итоговому состоянию базы и побочным эффектам, а не по вызовам инструментов и ответам.
  • Из 79 853 провальных попыток (12 моделей, 121 680 валидных прогонов) 67,24% завершились чисто, вызвав изменяющий состояние инструмент и не сообщив об ошибке инструмента.
  • Claude Opus 5.5 лидирует с 67,16% pass@1, но по числу задач, пройденных 20 из 20, равен Opus 5, по 241; Kimi-K3 решает хотя бы раз 476 из 507 задач, но стабильно, только 68.
  • Дешевле всего за одну успешную попытку, GPT-5.6 Sol ($0,127), но за надёжную задачу (20 из 20) он стоит $9,76; GPT-5.4 даёт $6,80, однако проходит планку лишь на 128 задачах.
  • По оценке авторов, примерно четыре из пяти сбоев, это работа с инструментами (восстановление после ошибок), а не рассуждение.

Почему это важно

Обычные оценки агентов смотрят на вызовы инструментов или на финальный ответ, а в примере из поста агент делает девять корректных вызовов и вежливо отвечает, но закрывает тикет со статусом «решён» вместо «на удержании». Авторы утверждают, что именно записи в базе решают вопрос, и показывают масштаб разрыва: две трети провалов в их наборе выглядят как чистое завершение без ошибок инструментов. Вторая мысль поста, один успех не равен надёжности: у моделей с близким pass@1 число задач, пройденных во всех 20 попытках, может сильно отличаться.

Кому это важно

Командам, которые внедряют ИИ-агентов в процессы с записью в реальные базы (заказы, тикеты, возвраты, страхование), и тем, кто выбирает модель под такую работу. Также авторам бенчмарков и систем оценки агентов: подход «траектория, заявление, состояние базы, доказательство, повторение, проверка на доверие» переносится на другие домены.

Как это применить

Авторы советуют относиться к доле 20/20 как к входному параметру проектирования, а не как к приговору. Практические шаги из поста: проверять итоговое состояние перед фиксацией изменений, а не пересказ модели; классифицировать ошибки инструментов и системы, чтобы повторы целились в восстанавливаемые; сузить набор инструментов до необходимого для сценария; требовать одобрения человека для изменений, которые нельзя дёшево откатить. Авторы прямо говорят, что прирост от этих мер на данном бенчмарке не измерен. При выборе модели смотреть не на pass@20, а на число стабильно решаемых задач и стоимость надёжной задачи. Сам бенчмарк можно запустить через OpenEnv; инструкции по запуску в пересказ не вошли.

Можно ли доверять

Это совместный пост Microsoft и Hugging Face по их собственной статье (ThinkingBox paper); цифры взяты у авторов, независимой проверки в тексте нет. Стоимость, оценочная: токены из полных кампаний, пересчитанные по полным прайсам OpenRouter+ без скидок и без квантованных эндпоинтов; авторы сами называют её индексом сравнительной эффективности, а не счётом. Доли сигнатур сбоев, невзвешенные средние по моделям и наблюдаемым меткам, а не причинные объяснения. Часть значений (таблицы 1, 3, 5 и рисунки) в тексте поста как числа не приведена. Из 18 протестированных моделей показаны 12, шесть с pass@1 ниже 33% опущены.

Риски и подводные камни

Результаты сильно зависят от домена: Claude Opus 4.6 набирает 68,62% в рознице и 8,30% в автостраховании, поэтому общий pass@1 мало говорит о вашей области. Лидер по одной метрике может проигрывать по другой: Kimi-K3 лучше всех покрывает задачи хотя бы раз, но стабильно проходит только 13,41%. Метрика стоимости надёжной задачи опирается на бинарное условие «20 из 20», а выбор модели с наименьшей ценой за такую задачу (GPT-5.4, $6.80) означает всего 128 пройденных задач против 241 у лидеров. Рекомендации по снижению сбоев пока не подтверждены измерениями.

«Траектория, это заявление. Состояние базы данных, это доказательство. Повторение, это проверка на доверие.»

— авторы поста, Microsoft и Hugging Face