HarnessOpt-Bench: новый бенчмарк оценивает, как модели дорабатывают обвязку ИИ-агентов

Варун Урсекар с соавторами представили HarnessOpt-Bench, бенчмарк, который систематически измеряет способность больших языковых моделей улучшать «обвязку» ИИ-агента: системные промпты, набор инструментов, логику управления (control flow), память и код оркестрации, окружающие саму модель. Авторы указывают, что возможности агентной системы зависят не только от весов модели, но и от качества этой обвязки, поэтому автоматическая оптимизация обвязки, это одновременно и способ улучшать ИИ-системы, и отдельная способность, которую сами модели должны продемонстрировать. До сих пор в отрасли не было общего протокола для измерения этой способности у передовых моделей.
В HarnessOpt-Bench роль «оптимизатора» играет связка ИИ-модель плюс кодовая обвязка (coding harness). Оптимизатор получает исходную («seed») обвязку целевого агента, оценочную обратную связь по её работе и фиксированный бюджет обращений к целевой оценке. Он редактирует обвязку и выдвигает финального кандидата, которого оценивают по нормализованному приросту качества относительно исходной версии, на отложенной тестовой части данных, недоступной оптимизатору на протяжении всего поиска. Доверенная среда исполнения следит за границей между поиском и оценкой, замеряет расход ресурсов целевым агентом и сохраняет версии кандидатов для последующего аудита.
Авторы проверили 5 передовых ИИ-моделей в роли оптимизаторов, как в общей для всех кодовой обвязке, так и в «родной» обвязке каждой модели, на 4 разных прикладных задачах, всего 111 оценённых прогонов. Результаты показывают: модели-оптимизаторы различаются между собой сильнее, чем кодовые обвязки, через которые они действуют; «родная» обвязка модели не всегда даёт лучший результат по сравнению с общей; а прирост качества сильно колеблется в зависимости от задачи и от того, с какой исходной обвязки стартует оптимизация. По выводу авторов, оптимизация обвязки, измеримая и различающая модели способность, в которой остаётся большой простор для улучшения.
Ключевые факты
- HarnessOpt-Bench, новый бенчмарк для оценки способности ИИ-моделей автоматически улучшать «обвязку» агентных систем: промпты, инструменты, control flow, память и оркестрацию.
- Оптимизатор (модель плюс кодовая обвязка) получает исходную обвязку, оценочную обратную связь и ограниченный бюджет обращений к оценке, редактирует обвязку и предлагает финального кандидата.
- Итог измеряется как нормализованный прирост качества относительно исходной обвязки на отложенном тестовом наборе, недоступном во время поиска; границу защищает доверенная среда исполнения.
- Проверены 5 передовых моделей в роли оптимизаторов на 4 задачах, всего 111 оценённых прогонов.
- Модели-оптимизаторы различаются сильнее, чем кодовые обвязки; родная обвязка модели не всегда лучше общей; прирост качества сильно варьируется между задачами.
Почему это важно
Возможности агентных ИИ-систем определяются не только весами модели, но и обвязкой вокруг неё, промптами, инструментами, логикой управления, памятью и оркестрацией. Улучшение этой обвязки автоматически, силами самой модели, многообещающий путь к более сильным агентным системам, но до HarnessOpt-Bench у отрасли не было общего протокола, чтобы измерить, насколько хорошо разные модели с этим справляются.
Кому это важно
Разработчикам агентных ИИ-систем и исследователям, которые создают или выбирают модели для автоматической доработки промптов, инструментов и логики агентов, а также тем, кто оценивает, какая модель лучше подходит на роль «оптимизатора» в подобных пайплайнах.
Как это применить
Бенчмарк задаёт протокол: исходная обвязка целевого агента, оценочная обратная связь, фиксированный бюджет обращений к оценке и итоговая проверка на отложенном тестовом наборе через доверенную среду исполнения. Такой протокол можно использовать, чтобы сравнивать модели друг с другом в роли оптимизаторов обвязки и выбирать, какую кодовую обвязку, общую или «родную» для модели, задействовать в конкретной задаче.
Можно ли доверять
Источник, препринт с описанием методологии и результатов 111 оценённых прогонов на 5 моделях и 4 задачах; авторы подробно описывают устройство бенчмарка и механизм защиты тестовых данных доверенной средой исполнения. В тексте не названы ни конкретные оценённые модели, ни численные показатели прироста по каждой из них, только качественные выводы, что ограничивает возможность независимо проверить конкретные цифры.
Риски и подводные камни
Само исследование фиксирует нестабильность: прирост качества сильно варьируется в зависимости от задачи и от того, с какой исходной обвязки стартует оптимизация, а «родная» обвязка модели не всегда превосходит общую. Это значит, что автоматическая оптимизация обвязки пока не даёт предсказуемого результата и требует проверки под конкретную задачу, а не слепого доверия к тому, что модель сама всё улучшит.