Tencent выпустила WorkBuddy Bench, бенчмарк для кодинг-агентов, задачи которого нельзя найти в интернете

Tencent выпустила WorkBuddy Bench, бенчмарк для кодинг-агентов, задачи которого нельзя найти в интернете

Компания Tencent выпустила WorkBuddy Bench, открытый мультидоменный набор задач для оценки ИИ-агентов, которые пишут и правят код. Вместе с самим бенчмарком опубликован отчёт: он описывает, как строились задания, как их оценивают, и приводит кросс-модельный лидерборд.

В основе, единая система для конструирования и запуска заданий по четырём рабочим доменам: разработка на уровне репозитория (Code), фронтенд-разработка (Web), офисные и деловые сценарии (Office) и red/blue-team-задачи по безопасности (Security); состав заданий подобран так, чтобы отражать реальное распределение рабочей нагрузки агента, а не собран произвольно. Большинство подобных бенчмарков берут условия задач прямо из текста реальных issue и пул-реквестов на GitHub, но этот же текст вместе с готовым решением мог попасть в обучающие данные модели, и тогда агент не решает задачу заново, а просто «вспоминает» ответ. В WorkBuddy Bench каждое задание не копирует исходный текст: оно восстанавливается по мотивам настоящего коммита, пул-реквеста или бизнес-сценария методом реверс-инжиниринга и переписывается заново, как короткий разговорный запрос «от лица» пользователя. Из-за этого сам текст задания нельзя найти поиском по интернету и выйти через него на исходный issue, пул-реквест или цепочку коммитов, из которых оно сделано.

От секретности при этом принципиально отказываются: весь датасет выложен открыто, директории с заданиями, образы окружений, система оценки, тесты и эталонные решения. Устойчивость к утечке данных здесь держится не на том, что бенчмарк «спрятан», а на самой конструкции заданий плюс на версионировании датасета, то есть на возможности обновлять и ротировать задания со временем. Такая открытость означает, что любая третья сторона может перезапустить каждое задание и проверить его содержимое: авторы прогоняют бенчмарк по единому воспроизводимому протоколу на двух агентских инструментах, CodeBuddy Code и Claude Code.

У каждого из четырёх доменов свой способ проверки решения, поэтому результаты по разным доменам не сравнивают напрямую и общий балл по всему бенчмарку не публикуют, есть только отдельный кросс-модельный лидерборд, который сравнивает между собой несколько семейств моделей. Конкретные числовые результаты и полный список протестированных моделей в описании методики не приводятся.

Ключевые факты

  • Tencent выпустила WorkBuddy Bench, открытый мультидоменный бенчмарк для оценки ИИ-агентов, которые пишут и правят код.
  • Четыре домена задач: разработка на уровне репозитория (Code), фронтенд-разработка (Web), офисные и деловые сценарии (Office), red/blue-team-задачи по безопасности (Security), у каждого свой способ проверки решения.
  • Задание не копирует текст исходного issue или пул-реквеста, а переписано как короткий разговорный запрос, так его нельзя найти поиском по интернету и «списать» готовый ответ, попавший в обучающие данные модели.
  • Весь датасет открыт: директории заданий, образы окружений, система оценки, тесты, эталонные решения; устойчивость к утечке данных держится на конструкции заданий и версионировании датасета, а не на секретности.
  • Бенчмарк прогоняют на двух агентских инструментах, CodeBuddy Code и Claude Code; общего балла по всем доменам нет, только отдельный кросс-модельный лидерборд.

Почему это важно

Многие бенчмарки для кодинг-агентов берут задачи прямо из текста реальных issue и пул-реквестов на GitHub. Это удобно, но ненадёжно: если формулировка issue вместе с готовым решением уже встречалась в обучающих данных модели, агент может просто «вспомнить» ответ вместо того, чтобы решить задачу заново, и рейтинг перестаёт отражать реальные способности. WorkBuddy Bench закрывает именно эту лазейку: задание не копирует исходный текст, а переписывается заново как короткий разговорный запрос, так что найти его поиском по интернету и выйти на готовое решение не получится. Плюс охват шире, чем «только код»: в набор входят фронтенд, офисные и деловые сценарии и задачи по безопасности, более широкий срез реальной работы, которую пытаются поручить ИИ-агентам.

Кому это важно

В первую очередь, командам, которые разрабатывают и тестируют кодинг-агентов и которым нужна не «заученная», а честная оценка качества. Также, компаниям, которые выбирают, каким агентом или моделью закрывать реальные инженерные, фронтенд-, офисные задачи и задачи по безопасности: кросс-модельный лидерборд сравнивает несколько семейств моделей по единой методологии сразу в нескольких доменах. И отдельно, авторам других бенчмарков: сама методика (переписать задание своими словами, опубликовать всё открыто и версионировать датасет вместо того, чтобы его прятать) предлагается как воспроизводимый рецепт защиты от утечки данных.

Как это применить

Датасет и вся инфраструктура вокруг него открыты: директории с заданиями, образы окружений, систему оценки, тесты и эталонные решения можно скачать и прогнать через собственного агента. Авторы уже прогнали бенчмарк по единому воспроизводимому протоколу на двух агентских инструментах, CodeBuddy Code и Claude Code, и подчёркивают, что любая третья сторона может перезапустить каждое задание и проверить его содержимое самостоятельно. Поскольку у каждого из четырёх доменов свой инструмент проверки решения, ориентироваться стоит на результаты по конкретному домену, а не на единый общий балл: авторы прямо пишут, что результаты по доменам между собой не сравнивают и общего балла не выводят.

Можно ли доверять

В плюс бенчмарку, задания выведены не из синтетики, а из настоящих коммитов, пул-реквестов и бизнес-сценариев; весь набор открыт для независимой проверки; устойчивость к утечке данных объясняется не тем, что бенчмарк «спрятан» (спрятанное рано или поздно раскрывается и обесценивается), а конструкцией заданий плюс версионированием датасета. В минус, источник этой информации: отчёт самой команды, которая и представила бенчмарк (Tencent WorkBuddy Bench Team), а не независимая проверка со стороны. Конкретные числовые результаты моделей и их полный список в описании методики не приведены, поэтому судить о реальной сложности заданий по одной вводной части пока нельзя.

Риски и подводные камни

Контаминация не снимается раз и навсегда: если переписанная формулировка окажется недостаточно далека от исходной или если сам открытый датасет со временем попадёт в обучающие корпуса будущих моделей, понадобится как раз то версионирование и обновление заданий, о котором авторы говорят как о втором защитном механизме, то есть бенчмарк придётся периодически обновлять, а не считать проблему решённой раз и навсегда. Из-за того что у доменов разные инструменты проверки и общего балла нет, сведение результатов WorkBuddy Bench к одному числу или одному месту в рейтинге, упрощение: корректно сравнивать модели можно только внутри одного домена. И ещё: из всего двух агентских инструментов, на которых пока прогнан бенчмарк, один, CodeBuddy Code; это стоит держать в уме как контекст при чтении лидерборда.

«Поскольку датасет публикуется открыто, директории заданий, образы окружений, система оценки, тесты и эталонные решения, устойчивость к утечке данных держится на самой конструкции заданий вместе с версионированием датасета, а не на секретности.»

— Tencent WorkBuddy Bench Team