HarnessDev: ИИ-агенты уже строят себе рабочую обвязку (harness), но не умеют стабильно её улучшать

По мере того как ИИ-агенты переходят из исследовательских прототипов в инструменты, которые реально разворачивают в проде, их результат всё сильнее определяется не только весами модели, но и внешней по отношению к модели инфраструктурой исполнения, так называемой обвязкой (harness): системными инструкциями, циклом «рассуждение → действие», набором инструментов и памятью агента. Смена одной только обвязки при неизменных весах модели способна существенно изменить итоговый результат на задаче. При этом типичная практика оценки ИИ-агентов эту обвязку фиксирует и меряет только конечный результат на задачах, то, насколько модель способна сама построить такую обвязку, изучено гораздо хуже.
Авторы работы представили HarnessDev, бенчмарк, который переносит единицу оценки с результата задачи на саму работоспособную инфраструктуру. Бенчмарк состоит из двух этапов. На первом, этапе создания (Creation), агент стартует с минимального «зерна» и небольшого числа примеров и должен построить с нуля полноценную исполнительную систему. На втором, этапе эволюции, или доработки (Evolution), агент берёт уже построенную им самим на первом этапе обвязку и итеративно дорабатывает её, опираясь на обратную связь от реального выполнения задач, с целью улучшить показатели на бенчмарке. Каждую построенную обвязку затем проверяют по двум осям: по способности решать задачи, доле успеха на отложенном, скрытом от разработки наборе заданий, и по эффективности, стоимости выполнения в токенах.
Опубликованные результаты этапа создания охватывают шесть моделей-создателей обвязки, четыре предметные области и пять итоговых бенчмарков, в сумме 2207 уникальных заданий; сами задания итоговой проверки на этапе построения от агента были скрыты.
Построенные агентами обвязки заметно уступают зрелым, написанным вручную эталонным решениям в задачах, связанных с кодом, а также с поиском и исследованием информации. При этом в задачах, связанных с письмом (текстами), и в экспериментах по машинному обучению самостоятельно построенные обвязки не уступают выбранным эталонам или превосходят их, правда, ценой сильно различающейся стоимости выполнения в токенах. Этап эволюции даёт некоторый прирост результатов, но он нестабилен и лишь частично переносится на отложенный набор заданий, не участвовавший в доработке. Отдельные эксперименты с фиксированной моделью-исполнителем показали: полученный прирост сильно зависит от того, какая именно модель исполняет обвязку, то есть улучшения плохо переносятся с одной модели на другую.
Ключевые факты
- Новый бенчмарк HarnessDev проверяет, способен ли ИИ-агент сам построить (этап создания) и затем доработать (этап эволюции) собственную исполнительную инфраструктуру, обвязку (harness), а не просто решить задачу под уже готовой чужой обвязкой.
- Построенные обвязки оценивают по двум осям: способности решать задачи, доле успеха на отложенном, скрытом от разработки наборе заданий, и эффективности, стоимости выполнения в токенах.
- Результаты этапа создания охватывают шесть моделей-создателей, четыре предметные области и пять итоговых бенчмарков (2207 уникальных заданий): агенты заметно уступают написанным вручную эталонам в коде и в поиске/исследовании, но не уступают или превосходят их в письме и в экспериментах по машинному обучению.
- Этап эволюции даёт некоторый прирост результатов, но он нестабилен и переносится на отложенные, скрытые задания лишь частично.
- Прирост от доработки обвязки сильно зависит от того, какая модель её исполняет, то есть плохо переносится с одной модели на другую.
Почему это важно
Когда обсуждают возможности ИИ-агентов, обычно говорят о весах модели, насколько она умна. Но, по наблюдению авторов работы, по мере того как агенты становятся не исследовательскими прототипами, а реально разворачиваемыми инструментами, их результат всё сильнее определяется внешней по отношению к модели инфраструктурой исполнения, обвязкой: системными инструкциями, циклом «рассуждение → действие», набором инструментов и памятью. Смена одной только обвязки при тех же весах модели способна существенно изменить итоговый результат задачи, а стандартная практика оценки ИИ-агентов эту переменную фиксирует и меряет только конечный результат на задачах. HarnessDev делает саму способность модели построить и доработать работоспособную инфраструктуру предметом отдельной, систематической проверки, а не побочным эффектом чужого инженерного решения.
Кому это важно
В первую очередь, тем, кто разрабатывает фреймворки и продукты на основе ИИ-агентов и решает, сколько инженерной работы над обвязкой можно доверить самой модели, а не команде людей. Полезно и тем, кто сравнивает агентные системы между собой: HarnessDev явно разводит два разных источника прогресса, улучшение весов модели и улучшение окружающей её инфраструктуры, и показывает, что выигрыш во втором не обязательно переносится с одной модели-исполнителя на другую. Важно и всем, кто оценивает или закупает агентные решения: результат работы агента может сильно зависеть от того, какая обвязка стоит вокруг него, а не только от того, какая модель лежит в основе.
Как это применить
Методику HarnessDev можно использовать как тестовый стенд при разработке агентных систем: модели дают минимальное «зерно» и небольшое число примеров и просят с нуля построить работающую исполнительную систему, а затем, доработать уже построенную ею самой обвязку, опираясь на обратную связь от реального выполнения задач. Итог проверяют на скрытом, не показанном заранее наборе заданий и по стоимости выполнения в токенах, что не даёт агенту заранее подсмотреть в критерии оценки. Из результатов следует практический вывод: в задачах, близких к письму и к экспериментам по машинному обучению, самостоятельно построенная агентом обвязка может не уступать ручной инженерной работе, тогда как в коде и в поиске/исследовании информации ручное инженерное решение пока предпочтительнее. И отдельно стоит проверять любую самостоятельно доработанную обвязку именно с той моделью, которая будет реально исполнять её в проде, перенос прироста на другую модель не гарантирован.
Можно ли доверять
У методики видна забота о строгости: результаты этапа создания опираются на шесть разных моделей-создателей, четыре предметные области и пять итоговых бенчмарков (2207 заданий в сумме), а сами задания итоговой проверки при построении обвязки от агента скрывали, это снижает риск подгонки решения под конкретный тест. В то же время сам текст даёт только качественные формулировки результата, «заметно уступают», «не уступают или превосходят», «сильно зависит от модели», без конкретных числовых показателей точности или стоимости, которые позволили бы независимо оценить масштаб эффекта. В источнике также не названы поимённо ни авторы работы, ни организация за ней; нет и формального перечня всех пяти бенчмарков или четырёх предметных областей, про код, поиск и исследование, письмо и эксперименты по машинному обучению известно только из итоговой формулировки результата, а не из отдельного описания структуры бенчмарка. Не раскрыто и то, из чего именно состоит стартовое «зерно» и как технически устроена доработка обвязки на этапе эволюции.
Риски и подводные камни
Главный риск, который показывает сам бенчмарк: прирост от доработки обвязки на этапе эволюции нестабилен и лишь частично переносится на отложенные, не участвовавшие в доработке задания, улучшение, полученное в процессе самостоятельной правки, может оказаться локальным и не подтвердиться на независимой проверке. Второй риск, зависимость от исполняющей модели: по данным экспериментов с фиксированной моделью-исполнителем, прирост от доработки сильно зависит от того, какая именно модель выполняет обвязку, то есть перенос улучшений с одной модели на другую не гарантирован. Наконец, в задачах, связанных с кодом и с поиском и исследованием информации, самостоятельно построенные агентом обвязки всё ещё заметно уступают зрелым решениям, написанным вручную инженерами-людьми, полагаться на полностью самостоятельно построенную ИИ-агентом инфраструктуру в этих областях пока рискованно.