Argo-Bench: тест из 210 задач показал, что ИИ-агенты плохо справляются с корпоративными данными

Argo-Bench: тест из 210 задач показал, что ИИ-агенты плохо справляются с корпоративными данными

В статье представлен Argo-Bench, набор из 210 задач по анализу данных и аналитике. Авторы исходят из того, что реальная корпоративная работа с данными требует рассуждать сразу над десятками таблиц, проводить статистический анализ и действовать по его результатам. Существующие бенчмарки text-to-SQL, как пишут авторы, оценивают только генерацию запросов, а аудиты нашли в их эталонных ответах частые ошибки. Кроме того, реальные корпоративные хранилища слишком чувствительны, чтобы их публиковать, поэтому такие бенчмарки строят на открытых наборах данных, где бизнес-событие укладывается в одну таблицу.

Чтобы обойти это ограничение, авторы смоделировали службу доставки еды в Нью-Йорке «в реальном масштабе»: 81 млн заказов в 2024 году, обоснованная экономика, схемы мошенничества и стимулы маркетплейса. Для этого они опирались на открытые данные, рецензируемую отраслевую литературу и регуляторные документы. Затем этот мир выгрузили в ERP-хранилище из 235 таблиц и 7,5 млрд строк, схема которого построена по образцу Oracle E-Business Suite.

Истинное состояние симулятора от агента скрыто: чтобы действовать, ему нужно сначала восстановить факты, изучая хранилище. Argo-Bench выходит за рамки text-to-SQL: агент подаёт действия, например блокирует мошеннические аккаунты, распределяет бюджет стимулов для курьеров или начисляет задолженную оплату, а проверяющая система оценивает каждое действие по его последствиям в симуляторе. У каждой задачи есть исполняемое эталонное решение, доказывающее, что её можно решить, используя только данные хранилища.

Результат: сильнейшая из 14 проверенных передовых и открытых моделей набирает 95 баллов и выше лишь на 34,8% задач, а в среднем получает 59,5 балла. Авторы надеются, что Argo-Bench продвинет разработку агентов, которые понимают реальные среды данных, ориентируются в них и действуют внутри них.

Ключевые факты

  • Argo-Bench, 210 задач по анализу данных в симулированной службе доставки еды в Нью-Йорке (81 млн заказов в 2024 году).
  • Данные выгружены в ERP-хранилище из 235 таблиц и 7,5 млрд строк по образцу схемы Oracle E-Business Suite.
  • Агент не просто пишет SQL, а совершает действия (блокировка мошеннических аккаунтов, бюджет стимулов курьерам, выплата задолженной оплаты), которые оцениваются по последствиям в симуляторе.
  • Сильнейшая из 14 моделей набирает 95 и выше лишь на 34,8% задач; средний балл, 59,5.
  • У каждой задачи есть исполняемое эталонное решение, использующее только данные хранилища.

Почему это важно

Популярные тесты text-to-SQL проверяют только составление запроса, а их эталонные ответы, по данным аудитов, часто ошибочны. Argo-Bench проверяет то, что нужно в реальной работе: найти нужные факты среди сотен таблиц и принять решение, последствия которого можно измерить. Результат лучшей модели, 95+ баллов лишь на 34,8% задач, показывает заметный разрыв между демонстрациями и корпоративной практикой.

Кому это важно

Командам, которые внедряют ИИ-агентов для аналитики и работы с корпоративными хранилищами данных, а также исследователям, строящим бенчмарки для агентов. Тем, кто выбирает модель для таких задач, полезен сам подход: оценка по последствиям действий, а не по совпадению SQL-запроса.

Как это применить

В описании не указаны ссылки на код или набор данных и лицензия, поэтому о прямом использовании бенчмарка судить нельзя. Практически полезна сама идея: проверять своих агентов на задачах, где нужно восстановить факты по многим таблицам, а затем совершить действие, и оценивать результат по его эффекту.

Можно ли доверять

Это описание из статьи, цифры приведены самими авторами. Из описания не видно, какие именно 14 моделей тестировались и какая из них сильнейшая, какова максимальная шкала баллов и что именно означает среднее 59,5. Данные не реальные: платформа доставки смоделирована по открытым данным, литературе и регуляторным документам. Названия авторов и организаций в описании нет.

Риски и подводные камни

Симуляция остаётся симуляцией: результат на ней не гарантирует такой же результат в настоящем хранилище компании. Устройство оценки раскрыто лишь фразой «по последствиям в симуляторе», а сравнения с остальными 13 моделями в описании нет, поэтому вывод о разрыве между моделями сделать нельзя.