Evo-Bench: бенчмарк проверяет, умеют ли ИИ-агенты сами дорабатывать свой харнес

Исследователи представили Evo-Bench, первый бенчмарк, который измеряет способность языковых моделей самостоятельно улучшать («эволюционировать») собственный агентный харнес: обвязку из промптов, инструментов и логики оркестрации, в которой работает ИИ-агент. До сих пор стандартные тесты агентов ограничивались решением статичных задач и не позволяли отделить улучшения самого харнеса от силы базовой модели, из-за чего результаты страдали от переобучения под конкретную задачу и не отражали долгую итеративную работу над харнесом.
Чтобы изолировать именно эту способность, авторы предложили новую конструкцию бенчмарка, управляемую харнесом: сначала через эволюцию вспомогательных задач отбираются задачи, которые действительно чувствительны к улучшениям фреймворка, затем применяется стратифицированное разбиение с учётом этой чувствительности, оно обеспечивает устойчивую обобщаемость между наборами задач. Бенчмарк охватывает три домена агентных задач: поиск (Search), офис (Office) и общие задачи (General).
Авторы протестировали девять передовых и открытых моделей и обнаружили, что лучшие из них добиваются абсолютного прироста качества до 16,6 балла, вплотную приближаясь к харнесам, вручную созданным людьми-экспертами (лучшим известным ручным решениям в этой области). При этом автономная эволюция харнеса превосходит человеческий харнес в общих задачах и особенно хорошо показывает себя в задачах поиска, но проседает в офисных задачах, которые требуют узкоспециализированных рабочих процессов обработки данных. Анализ также выявил временные аномалии, в частности, раннее насыщение (early saturation), когда рост качества останавливается раньше ожидаемого. Отдельно показано, что синтезированные моделями харнесы работают как переносимые структуры рассуждений: перенесённые на другие модели-исполнители, они стабильно повышают их результаты.
Ключевые факты
- Evo-Bench, первый бенчмарк, изолированно измеряющий способность ИИ-моделей улучшать собственный агентный харнес, а не решать статичные задачи
- Тестирование охватывает три домена, поиск, офис и общие задачи, на девяти передовых и открытых моделях
- Лучшие модели добились абсолютного прироста качества до 16,6 балла, приблизившись к харнесам, созданным людьми
- Автономная эволюция харнеса сильна в общих и поисковых задачах, но уступает человеческим харнесам в офисных задачах со специфичными рабочими процессами
- Синтезированные харнесы переносимы между моделями и стабильно улучшают результаты разных моделей-исполнителей, но анализ выявил аномалию, раннее насыщение прогресса
Почему это важно
До сих пор способность агента дорабатывать собственную обвязку, харнес, почти не измерялась отдельно от силы базовой модели: тесты решения статичных задач не показывают, может ли модель сама улучшить инфраструктуру, в которой работает. Evo-Bench закрывает именно этот пробел, он специально сконструирован так, чтобы отделить прирост от доработки харнеса от прироста за счёт более сильной базовой модели и не дать модели переобучиться под конкретную задачу.
Кому это важно
Разработчикам агентных систем и авторам агентных фреймворков, бенчмарк даёт способ сравнить модели именно по умению самостоятельно дорабатывать свою рабочую обвязку, а не по решению задач «в лоб». Полезен и исследователям, изучающим долгую итеративную самодоработку агентов, а не разовые ответы.
Как это применить
Практический вывод для тех, кто строит агентные системы: харнес, синтезированный моделью автономно, по качеству приближается к харнесу, созданному людьми-инженерами, а созданный одной моделью харнес переносим, его можно применить к другой модели-исполнителю и получить прирост качества и там. Но в задачах с узкоспециализированными рабочими процессами (домен Office в бенчмарке) автономная доработка харнеса пока проигрывает ручной, на такие задачи полагаться на самодоработку модели рано.
Можно ли доверять
Материал, научная работа (препринт на arXiv), опубликованная на площадке Hugging Face Papers; авторы указаны на странице Hugging Face Papers (первый, Lisheng Huang), но не названы в тексте самого абстракта, как и конкретные названия девяти протестированных моделей. Оценивать полноту и воспроизводимость методики без доступа к полному тексту статьи преждевременно.
Риски и подводные камни
Абстракт не раскрывает, что именно означает выявленная аномалия «раннее насыщение» и как часто она возникает, названа лишь как факт, без объяснения причин. Не приведены и подробные числовые результаты по каждому из трёх доменов отдельно, известен только один сводный показатель, 16,6 балла прироста у лучших моделей. Домен Office прямо назван слабым местом автономной доработки харнеса, что стоит учитывать при попытке применить подход к задачам с жёстко заданными рабочими процессами.