MerchantBench: новый бенчмарк показал разрыв между ИИ-агентами и людьми в e-commerce

MerchantBench: новый бенчмарк показал разрыв между ИИ-агентами и людьми в e-commerce

Большинство существующих бенчмарков проверяют ИИ-агентов на коротких задачах с мгновенным критерием успеха: сделал шаг, сразу видно, правильно или нет. Но в реальном применении агенту часто нужна другая способность, сохранять целенаправленное поведение на длинном горизонте и пересматривать решения по мере накопления новых данных. Авторы называют это долгосрочной согласованностью (long-term coherence) и утверждают, что проверить её можно только в постоянно действующей среде, где текущие действия ограничивают будущий выбор, обратная связь приходит с разной задержкой, а несогласованное поведение накапливает измеримый вред.

В качестве такой среды исследователи выбрали продажи в интернет-магазине: там решения по закупке товара, ведению карточек и ценам, управлению денежным потоком и реакции на сигналы разной скорости постоянно взаимосвязаны. На этой основе построен MerchantBench, симуляция на 365 дней с учётом каждого отдельного заказа, построенная на 98 843 реальных карточках товаров и снабжённая 26 инструментами для взаимодействия агента со средой (закупка, изменение цены, обработка заказов и так далее).

Ключевая механика бенчмарка, сочетание двух типов сигналов: события от поставщиков видны агенту сразу, а итоги по заказам покупателей приходят с задержкой. Агенту нужно параллельно вести жизненный цикл множества отдельных заказов и возвращаться к ранее принятым решениям, когда появляются новые данные.

Авторы прогнали через MerchantBench восемь языковых моделей под управлением двух разных агентных фреймворков, всего 48 прогонов, каждый длиной в 365 симулированных дней. Итог: между лучшими современными моделями и человеком остаётся большой разрыв. Лучшая по результату связка модель+фреймворк заработала лишь 27,3% от того итогового капитала (net assets), которого в среднем достигают в этой же симуляции люди.

Ключевые факты

  • MerchantBench, 365-дневная симуляция продаж в интернет-магазине на уровне отдельных заказов, построенная на 98 843 реальных карточках товаров
  • Агенту доступно 26 инструментов для действий: закупка у поставщиков, ведение карточек и цен, обработка заказов
  • Среда специально сочетает быстрые сигналы (события от поставщиков) с задержанными (итоги заказов покупателей), заставляя агента пересматривать старые решения
  • Протестировано восемь языковых моделей под двумя агентными фреймворками, 48 прогонов по 365 симулированных дней каждый
  • Лучшая связка модель+фреймворк достигла только 27,3% от среднего итогового капитала, который набирают люди-участники в той же роли

Почему это важно

Почти все распространённые тесты ИИ-агентов оценивают короткие изолированные задачи с мгновенным результатом. MerchantBench проверяет другое, способность агента вести дело месяцами: не терять курс, учитывать последствия своих же прошлых решений и подстраиваться под сигналы, которые приходят с разной задержкой. Это ближе к тому, как агент вёл бы себя в реальном длительном применении, а не в разовом тесте.

Кому это важно

Результат касается прежде всего тех, кто разрабатывает и оценивает ИИ-агентов для автономного управления бизнес-процессами, от торговли до любых задач с накопительным эффектом решений, а также исследователей, которые ищут более реалистичные способы измерять качество агентов за пределами коротких демонстраций.

Как это применить

MerchantBench можно использовать как полигон для сравнения агентных фреймворков и моделей на длинных горизонтах, до того, как поручать им реальное управление запасами, ценами или денежным потоком. Разрыв в 27,3% от результата человека, ориентир того, насколько ещё сырые современные агенты для подобных задач и что доверять им автономное управление капиталом пока рано.

Можно ли доверять

Методика прозрачна: конкретный масштаб (98 843 товарных карточек, 26 инструментов, 48 прогонов по 365 дней, восемь моделей и два фреймворка) и чёткая метрика сравнения, итоговый капитал агента против итогового капитала человека в той же среде. В открытом описании не указаны авторы, институции и конкретные протестированные модели, это ограничивает независимую проверку деталей, но сама конструкция теста звучит методологически строго.

Риски и подводные камни

Тест построен на симуляции интернет-магазина, это узкая предметная область, и разрыв в 27,3% не обязательно переносится на другие виды долгосрочных задач агентов. Также не раскрыто, какие именно модели тестировались и кто авторы работы, что мешает оценить возможный конфликт интересов или связь авторов с конкретными разработчиками ИИ.