PAST-Bench: бенчмарк проверяет, действительно ли ИИ-агенты учатся на своём опыте

Исследователи представили PAST-Bench, бенчмарк, который проверяет, действительно ли персональные ИИ-агенты становятся лучше со временем благодаря опыту, накопленному между сессиями: предпочтениям пользователя, истории задач, отработанным процедурам и усвоенным навыкам. Раньше это предположение системно не тестировалось.
Бенчмарк включает 26 сценариев и 204 эпизода, охватывающих четыре направления: память, повторное использование процедур, сбор информации и обновление данных. Каждый агент проходит упорядоченные последовательности задач в новых сессиях при одинаковых условиях, но с накопленным опытом то включённым, то отключённым, так авторы отделяют реальный эффект памяти от случайных колебаний. Оценивались не только итоговые результаты на поздних задачах, но и то, идёт ли улучшение по задуманному пути: сохранение опыта, его извлечение и обновление.
Тесты прошли семь базовых моделей и четыре агентных фреймворка. Улучшение от накопленного опыта действительно есть, но выражено неравномерно между разными способностями агента. Авторы отмечают: агенты с одинаковым итоговым приростом результата могут сильно различаться в том, подтверждён ли этот прирост доказательствами, что он получен именно через задуманный путь сохранения, извлечения и обновления опыта, а не как-то иначе.
Опираясь на эти выводы, авторы построили Hermes+, версию агентной системы Hermes с пятью целевыми доработками на разных этапах цикла работы агента. Hermes+ повышает средний прирост от накопленного опыта и даёт более чёткие доказательства правильного пути обучения; сильнее всего эффект проявляется на задачах, где агенту нужно заменить устаревшие данные новыми, хотя величина эффекта всё равно зависит от конкретной способности и модели. Код PAST-Bench и Hermes+ авторы выложили на GitHub.
Ключевые факты
- PAST-Bench: 26 сценариев и 204 эпизода по четырём направлениям, память, повторное использование процедур, сбор информации, обновление данных
- Протестированы семь базовых моделей и четыре агентных фреймворка
- Улучшение от накопленного опыта реальное, но неравномерное, и не всегда подтверждено правильным путём сохранения-извлечения-обновления
- Hermes+ (Hermes с пятью целевыми доработками) повышает средний прирост и даёт более чёткие доказательства правильного пути обучения; сильнее всего, на задачах замены устаревших данных
- Код PAST-Bench и Hermes+ выложен на GitHub
Почему это важно
Персональные ИИ-агенты всё активнее позиционируются как системы, которые «запоминают» пользователя и со временем становятся полезнее. До PAST-Bench это утверждение системно не проверялось: было неясно, действительно ли сохранённый опыт улучшает будущее поведение агента или наблюдаемый прирост результатов объясняется чем-то ещё. Бенчмарк впервые даёт инструмент для строгой проверки этого механизма и показывает разрыв между «агент стал показывать лучший результат» и «агент стал лучше именно потому, что научился на опыте».
Кому это важно
Разработчикам агентных фреймворков и персональных ИИ-ассистентов, тем, кто закладывает в продукт долгосрочную память и обучение на истории взаимодействий. Исследователям, изучающим рекурсивное самоулучшение и надёжность оценки ИИ-агентов. Компаниям, которые продают «умную память» как функцию продукта: бенчмарк даёт способ проверить, не пустой ли это маркетинг.
Как это применить
PAST-Bench и код Hermes+ выложены на GitHub, команды, разрабатывающие агентные системы с памятью, могут прогнать свою систему через 26 сценариев и 204 эпизода бенчмарка и посмотреть не только на итоговый прирост результата, но и на то, идёт ли он по задуманному пути сохранения, извлечения и обновления опыта. Пять доработок Hermes+ можно рассматривать как отправную точку для собственных улучшений агентного цикла, особенно для задач, где агенту нужно заменять устаревшие данные актуальными.
Можно ли доверять
Это исследовательская работа с открытым кодом на GitHub, что позволяет независимо воспроизвести бенчмарк и результаты. В то же время в доступном тексте аннотации не указаны ни авторы, ни институты, ни точные числовые показатели прироста Hermes+ относительно базового Hermes или других фреймворков, эти детали, вероятно, приведены в полном тексте статьи, но не в её кратком описании.
Риски и подводные камни
Авторы прямо предупреждают: прирост результата на поздних задачах, не гарантия, что агент действительно научился нужным образом. Часть агентов показывает такой же итоговый прирост, но без подтверждения, что он получен через правильный путь сохранения, извлечения и обновления опыта, то есть внешне похожие результаты могут скрывать разное качество обучения. Эффект от доработок Hermes+ тоже неравномерен: он сильнее всего проявляется на задачах замены устаревших данных и зависит от конкретной способности и модели, а не является универсальным улучшением.