Claude Opus 5 прошёл лишь 23,9% задач в новом бенчмарке агентостроения τ^τ-Bench

Claude Opus 5 прошёл лишь 23,9% задач в новом бенчмарке агентостроения τ^τ-Bench

ИИ-агенты всё чаще становятся частью боевого софта: их ставят на поддержку клиентов, разрешение споров и работу с внутренними системами компаний. При этом саму задачу построения таких агентов всё чаще перепоручают кодинг-агентам, но существующие бенчмарки почти ничего не говорят о том, способен ли ИИ довести такую разработку до конца в условиях, близких к реальному проекту для клиента.

Авторы представили τ^τ-bench (произносится «гипер-тау-бенч»), бенчмарк, в котором сама постройка агента и есть проверяемая задача. Агенту-разработчику дают тот же набор вводных, что получил бы реальный подрядчик: записи, которые реально ведёт бизнес, требования клиента, боевой API, через который обязаны идти все операции, кодовую базу, которую нужно унаследовать, и ограничения по стоимости обслуживания и выбору моделей. Из этого агент должен собрать полноценного агента поддержки клиентов, а итоговая оценка выставляется по тому, как собранный агент отрабатывает против отложенной выборки смоделированных пользователей. Всего в бенчмарке 53 задачи, охватывающие четыре домена.

Сильнейшая из проверенных конфигураций, Claude Opus 5, работающий под управлением Claude Code, проходит только 23,9% пользовательских симуляций. Для сравнения, эталонное решение, написанное экспертами вручную, набирает 82,2%.

По словам авторов, провалы моделей повторяют те же ошибки, что и у людей-разработчиков агентов: вместо глубокого понимания бизнес-записей модели ограничиваются поверхностными запросами к ним, почти не общаются с клиентом по ходу работы и слишком мало экспериментируют с архитектурой агента и с расходами на его обслуживание, вместо этого сдают первый же вариант, который вообще заработал.

Цель авторов, превратить работу по совместной с клиентом постройке агента в измеримую цель, на которую можно ориентировать кодинг-агентов.

Ключевые факты

  • τ^τ-bench проверяет не ответ на вопрос, а полную постройку рабочего агента поддержки клиентов с нуля, по записям бизнеса, требованиям клиента, боевому API, унаследованной кодовой базе и ограничениям по стоимости
  • Бенчмарк включает 53 задачи в четырёх доменах; оценка агента идёт по симуляциям против отложенных смоделированных пользователей
  • Лучший результат, у связки Claude Opus 5 и Claude Code: 23,9% успешных симуляций
  • Эталонное решение, написанное экспертами вручную, набирает 82,2%, почти в 3,5 раза больше лучшего результата ИИ
  • Типичные провалы моделей: поверхностные запросы вместо глубокого разбора записей, почти нулевая коммуникация с клиентом, минимум экспериментов с архитектурой и расходами, модели сдают первый рабочий вариант

Почему это важно

Постройку ИИ-агентов для бизнеса всё чаще отдают кодинг-агентам, но до сих пор не было бенчмарка, который проверял бы именно это, не написание кода как такового, а полный цикл разработки в условиях, близких к реальному клиентскому проекту: чужие данные, требования клиента, боевой API и бюджетные ограничения. τ^τ-bench закрывает этот пробел и сразу показывает масштаб разрыва: лучшая проверенная конфигурация с Claude Opus 5 набирает 23,9% против 82,2% у экспертов, разница почти в 3,5 раза.

Кому это важно

Разработчикам и исследователям, которые строят и тренируют кодинг-агентов (в том числе на базе Claude Code), как источник измеримой цели для этого класса задач. Компаниям, рассматривающим делегирование постройки клиентских ИИ-агентов кодинг-агентам, как сигнал о том, где именно модели пока проваливаются: не в написании кода, а в разборе бизнес-данных, общении с клиентом и итеративном улучшении архитектуры.

Как это применить

Авторы предлагают τ^τ-bench как измеримую цель для дальнейшего обучения и оценки кодинг-агентов на задачах именно такого типа, сквозная постройка агента, а не изолированное программирование. Для практиков из текста следует практический вывод: если поручать ИИ-агенту постройку клиентского агента, стоит закладывать отдельные шаги на уточняющие вопросы к записям бизнеса и на коммуникацию с клиентом, а не полагаться на то, что первый работающий вариант окажется достаточным.

Можно ли доверять

Источник, полный текст страницы статьи на Hugging Face Papers, без урезаний. Имена авторов и организации в тексте не указаны, поэтому в пересказе они не приводятся. В тексте также нет разбивки результатов по доменам или задачам, нет сопоставления с прежними бенчмарками агентостроения и нет данных о доступности бенчмарка. Заявленные цифры (23,9% и 82,2%), самоотчёт авторов, представляющих собственный бенчмарк, что типично для препринтов такого рода и не является независимой проверкой.

Риски и подводные камни

Результат в 23,9% относится к одной конкретной конфигурации, Claude Opus 5 под управлением Claude Code, и к конкретному набору из 53 задач в четырёх доменах; он не обязан обобщаться на другие модели, другие агентные обвязки или задачи вне этого бенчмарка. Возможен и обратный риск: как только τ^τ-bench станет ориентиром для тренировки кодинг-агентов, появится соблазн оптимизироваться именно под его задачи, а не под реальное качество постройки агентов для бизнеса.