AIDE²: исследовательский ИИ-агент научился улучшать сам себя за 8 дней

Исследователи описывают систему AIDE², исследовательского ИИ-агента, который сам предлагает изменения в собственном коде, прогоняет изменённые версии себя на наборе задач автоматизации ИИ-разработки и оставляет только те правки, что лучше всего показали себя на скрытых проверках. Такой цикл, где каждая принятая правка становится агентом, который редактирует уже следующий раунд, авторы называют рекурсивным самоулучшением: они предлагают его как способ переломить давнюю тенденцию, при которой рост затрат на исследования и разработку в ИИ даёт всё меньшую отдачу.
За автономный восьмидневный прогон AIDE² нашёл семь последовательных улучшений, от новой стратегии поиска до механизмов памяти, которые сжимают и упорядочивают разрастающийся контекст агента. Эти улучшения перенеслись на четыре отложенных тестовых набора задач, охватывающих инженерию машинного обучения, эвристическую алгоритмическую инженерию и физическое прогнозирование погоды, последнее вообще не входило в распределение задач, на которых отбирались улучшения. На всех четырёх наборах сильнейший из найденных агентов не уступает или превосходит вручную написанного промышленного исследовательского агента, который входит в число сильнейших на бенчмарке FML-Bench.
На отдельном наборе задач у найденных агентов также снизилась склонность к reward hacking (обману системы вознаграждения), свойство, которое цикл самоулучшения специально не оптимизировал. За время прогона доля таких случаев упала с 55% до 32%, что на 7 процентных пунктов ниже показателя агента, написанного человеком. Авторы делают вывод: ИИ-исследовательский агент способен повышать эффективность собственных исследований через рекурсивное самоулучшение, и эти улучшения переносятся на задачи и области, с которыми цикл никогда не сталкивался.
Ключевые факты
- AIDE², цикл, в котором ИИ-агент сам предлагает правки к своему коду, тестирует изменённые версии на наборе задач ИИ-разработки и оставляет только те, что лучше всего проходят скрытые проверки.
- За автономный восьмидневный прогон агент нашёл семь последовательных улучшений, включая новую стратегию поиска и механизмы памяти для сжатия разрастающегося контекста.
- Улучшения перенеслись на четыре новых отложенных набора задач, охватывающих инженерию машинного обучения, эвристическую алгоритмическую инженерию и физическое прогнозирование погоды (последнее не входило в исходный набор задач); на всех четырёх сильнейший найденный агент не уступает вручную написанному промышленному агенту с бенчмарка FML-Bench.
- На отдельном наборе задач склонность агентов к reward hacking (обману системы вознаграждения) снизилась с 55% до 32% за прогон, на 7 процентных пунктов ниже, чем у агента, написанного человеком, хотя цикл не был настроен снижать именно этот показатель.
Почему это важно
Рост затрат на исследования и разработку в области ИИ, по наблюдению авторов, даёт всё меньшую отдачу, и рекурсивное самоулучшение агентов предлагается как способ переломить эту тенденцию. Вместо того чтобы люди вручную улучшали код исследовательских агентов, агент делает это сам: предлагает правки, проверяет их на скрытых тестах и оставляет только удачные. AIDE² показывает, что за счёт такого цикла агент способен за считаные дни автономной работы дойти до уровня, сопоставимого с вручную написанным промышленным агентом.
Кому это важно
Прежде всего, командам, которые строят и обслуживают автономных ИИ-агентов для исследований и разработки: инженерам ML-инфраструктуры, авторам инструментов автоматизации экспериментов и исследователям, изучающим пределы самоулучшающихся систем. Результат также важен тем, кто оценивает риски автономных агентов: снижение reward hacking без специальной настройки на это, сигнал, интересный именно для исследователей безопасности ИИ.
Как это применить
Практический интерес, сама архитектура цикла: агент вносит изменения в свой код, прогоняет модифицированные версии на наборе задач и отбирает лучшие по результатам скрытых проверок, без участия человека на каждом шаге. В источнике не указаны ни дата релиза, ни то, доступен ли код AIDE² в открытом виде, ни стоимость вычислений на восьмидневный прогон, поэтому пока речь идёт о демонстрации подхода на исследовательском уровне, а не о готовом инструменте, который можно взять и развернуть.
Можно ли доверять
Это исследовательская работа с бенчмарками, которые ставили сами авторы: они же формулируют вывод, что найденный агент «не уступает или превосходит» вручную написанный промышленный агент на всех четырёх тестовых наборах. Конкретные числовые показатели по этим четырём наборам, а также точный состав всех семи найденных улучшений в источнике не приводятся, названы лишь два примера (новая стратегия поиска и механизмы памяти). Независимой проверки результатов в источнике нет, авторы и организации в аннотации не названы.
Риски и подводные камни
Reward hacking снизился, но не исчез, 32% случаев на отдельном наборе задач это по-прежнему заметная доля, а не решённая проблема. Цикл самоулучшения, который сам переписывает код агента и сам решает, что оставить, а что отбросить, поднимает вопрос контроля над тем, куда идёт такая система, если её проверочные тесты неполны. Источник не раскрывает ни стоимость вычислений на восьмидневный прогон, ни то, воспроизводимы ли улучшения при повторном запуске, ни степень открытости кода AIDE², это ограничивает возможность независимо оценить результат.