Оценка семи ИИ-агентов на 36 задачах показала: методологической новизны почти нет

Исследователи представили новый фреймворк для оценки автономных ИИ-агентов на долгих многошаговых задачах ИИ-исследований и разработки. Идея в том, что итоговый счёт (прошла задача агент или нет) сам по себе не показывает, где именно теряется или набирается прогресс внутри прогона и помогает ли накопленный опыт принимать решения в дальнейшем, поэтому авторы пошли дальше финального результата.
По новому фреймворку оценили семь передовых моделей на 36 долгих задачах. Метрики строятся на правилах и характеризуют поведение агента внутри одного прогона по трём измерениям: формулировка решения (Solution Framing), исполнение (Execution) и контроль обратной связи (Feedback Control). Отдельно проведены контролируемые сравнения, чтобы оценить, как агент повторно использует опыт, в рамках одной задачи и между разными задачами.
Главный вывод: нынешние агенты ведут себя больше как инженеры-оптимизаторы, чем как полностью самостоятельные исследователи. Они умеют формулировать и реализовывать практичные решения, но результат заметно колеблется от прогона к прогону. Их сильнейшие решения в основном адаптируют или комбинируют уже известные техники, а подлинная методологическая новизна встречается редко.
Более детальный анализ показал, что на наблюдаемый результат влияют сразу несколько факторов: похожие итоговые результаты могут скрывать разные узкие места процесса; повторное использование накопленного опыта может как помогать агенту, так и сбивать его с толку в последующих решениях; а конструкция программной обвязки агента (harness) влияет на стабильность результата. Из этих находок авторы выводят конкретные направления для улучшения: тренировку моделей, стратегии на этапе вывода (inference-time), управление накопленным опытом и саму конструкцию обвязки.
Ключевые факты
- Новый фреймворк оценил семь передовых ИИ-моделей на 36 долгих многошаговых задачах ИИ-исследований и разработки
- Оценка смотрит не только на итоговый счёт, а на поведение агента внутри прогона по трём измерениям: формулировка решения, исполнение, контроль обратной связи
- Агенты формулируют и реализуют практичные решения, но результат сильно колеблется от прогона к прогону
- Сильнейшие решения агентов в основном адаптируют или комбинируют уже известные техники, подлинная методологическая новизна редка
- Похожие итоговые результаты могут скрывать разные узкие места процесса; повторное использование опыта может как помогать, так и мешать; конструкция обвязки (harness) влияет на стабильность
Почему это важно
Оценку ИИ-агентов обычно сводят к финальному счёту: прошла задача, не прошла. Это не показывает, где именно теряется прогресс и помогает ли агенту накопленный опыт принимать решения дальше. Работа предлагает более честную методологию, смотреть на процесс, а не только на результат: как агент формулирует решение, как исполняет и как использует обратную связь. Итог получается менее оптимистичным, чем принято думать: несмотря на возможности передовых моделей, подлинная методологическая новизна остаётся редкостью, а поведение агентов больше похоже на инженерную оптимизацию, чем на самостоятельное исследование.
Кому это важно
Разработчикам фреймворков и программных обвязок (harness) для автономных ИИ-агентов, исследователям, проектирующим долгие многошаговые агентные задачи, и командам, которые рассматривают агентов для реальных задач исследований и разработки, им полезно знать, что стабильность результата и качество повторного использования опыта, а не только «сырая» мощь модели, определяют, насколько агенту можно доверить самостоятельную работу.
Как это применить
Работа не даёт готового продукта, а указывает направления улучшения: тренировку моделей, стратегии на этапе вывода (inference-time), управление накопленным опытом агента и конструкцию его программной обвязки (harness design). Именно эти рычаги, по данным авторов, определяют, помогает или мешает агенту прошлый опыт и насколько стабилен результат от прогона к прогону.
Можно ли доверять
Источник, предзагруженная аннотация статьи с Hugging Face Papers: в доступном тексте нет имён авторов, институтов, даты публикации, числовых оценок по каждой из семи моделей и самих названий этих моделей. Методология при этом описана как систематическая, 36 задач, метрики на основе правил, контролируемые сравнения для оценки повторного использования опыта, но проверить детали без полного текста статьи нельзя.
Риски и подводные камни
Главный риск, принять вывод как приговор всем ИИ-агентам сразу: оценка охватывает лишь семь моделей на 36 задачах определённого профиля, а без названий моделей нельзя понять, распространяется ли вывод на конкретный продукт, которым кто-то пользуется. Стоит учитывать и эффект обвязки: по словам авторов, её конструкция сама влияет на стабильность результата, значит слабый показатель может отражать не столько модель, сколько то, как её обвязали в рамках конкретного эксперимента.