GDPevo: новый бенчмарк оценил самообучение ИИ-агентов на бизнес-задачах

GDPevo: новый бенчмарк оценил самообучение ИИ-агентов на бизнес-задачах

Оценивать самообучение ИИ-агентов, способность обновлять внутреннее состояние на основе прошлого опыта и использовать его для решения новых, но похожих задач, до сих пор было трудно. По словам авторов, прежние бенчмарки слабо покрывали экономически значимые области, не всегда были устроены так, чтобы прирост точности на тесте можно было однозначно связать именно с обучением, и оставались уязвимы к утечке тестовых данных в обучающие корпуса.

GDPevo решает эти проблемы через механизм «гибридизации правил»: каждый бизнес-процесс раскладывается на атомарные бизнес-правила, часть этих правил распределяется по обучающим задачам, а их комбинации собираются в отдельные, отложенные для теста задачи. За счёт этого любой прирост точности на тесте можно проследить до конкретного обучающего опыта.

Бенчмарк охватывает workflow из CRM, ERP, финансов, здравоохранения, юриспруденции и работы с данными. Версия V1 содержит 120 задач в 12 группах, по 5 обучающих и 5 отложенных тестовых задач на группу. Конвейер генерации задач полностью автоматизирован и способен за два дня расширить набор до 240 задач в 24 группах (версия V2), это практический ответ на риск утечки задач в обучающие данные будущих моделей.

На GDPevo проверили четыре агента (каждый, связка программной обвязки и модели) под четырьмя типами сопровождения. Самообучение стабильно повышало точность на отложенных задачах, прирост доходил до 16,44 процентного пункта. Но даже лучшие дообученные агенты остаются далеко позади эталонного потолка в 91,6% (результат полностью информированного «идеального» агента-оракула). Авторы делают вывод: способность современных агентов к самообучению пока далека от полной реализации.

Конвейер, бенчмарк и полные результаты оценки выложены в открытый доступ на GitHub, в репозитории Prism-Shadow/GDPevo.

Ключевые факты

  • GDPevo, новый бенчмарк для оценки самообучения ИИ-агентов на реальных бизнес-процессах: CRM, ERP, финансы, здравоохранение, юриспруденция, работа с данными.
  • Ключевой механизм, гибридизация правил: бизнес-процесс раскладывается на атомарные правила, часть попадает в обучающие задачи, а их комбинации, в отложенные тестовые, так что прирост точности можно однозначно связать с обучением.
  • V1 включает 120 задач в 12 группах (по 5 обучающих и 5 тестовых на группу); автоматизированный конвейер способен за два дня расширить набор до 240 задач в 24 группах (V2), защита от утечки задач в обучающие данные.
  • На бенчмарке проверили четыре агента (обвязка + модель) под четырьмя типами сопровождения: самообучение стабильно повышало точность на отложенных задачах, до 16,44 процентного пункта.
  • Лучшие дообученные агенты остаются далеко позади эталонного потолка в 91,6%, авторы делают вывод, что самообучение агентов пока далеко от полной реализации.

Почему это важно

Оценивать способность ИИ-агентов дообучаться на собственном опыте до сих пор было трудно: прежние бенчмарки слабо покрывали экономически значимые задачи, не всегда были устроены так, чтобы прирост на тесте можно было однозначно связать с обучением, и были уязвимы к утечке тестовых данных в обучающие корпуса. GDPevo решает все три проблемы разом за счёт гибридизации правил и полностью автоматизированной генерации новых наборов задач.

Кому это важно

Разработчикам агентных систем и командам, которые внедряют автономных ИИ-агентов в CRM, ERP, финансы, здравоохранение и юридические процессы: бенчмарк даёт способ проверить, действительно ли агент становится лучше от опыта, а не просто подгоняется под тестовую выборку. Полезен и исследователям, которые строят собственные бенчмарки самообучения.

Как это применить

Авторы выложили в открытый доступ и сам бенчмарк, и конвейер генерации задач, и полные результаты оценки, на GitHub, в репозитории Prism-Shadow/GDPevo. Конвейер полностью автоматизирован и способен за два дня расширить набор с 120 задач в 12 группах (V1) до 240 задач в 24 группах (V2), так что команды могут прогонять собственных агентов и получать свежие, ещё не «утёкшие» наборы тестов.

Можно ли доверять

Текст статьи размечен полностью, но сам он не называет ни авторов, ни организацию, ни конкретные модели и обвязки, которые тестировались, эти детали, видимо, раскрыты в полной публикации и на GitHub, а не в аннотации. Итоговые цифры (16,44 п.п. прироста, потолок 91,6%) приведены как агрегат по всем агентам, разбивки по каждому из четырёх агентов в тексте нет, как и объяснения, чем отличаются четыре типа сопровождения.

Риски и подводные камни

Главный вывод исследования, тревожный, а не победный: даже лучшие дообученные агенты остаются далеко позади эталонного потолка в 91,6%, а значит, способность агентов к самообучению «пока далека от полной реализации», как пишут сами авторы. Для бизнеса это сигнал не переоценивать готовность самообучающихся агентов к реальному внедрению в CRM, ERP, финансовые, медицинские и юридические процессы уже сейчас.