PILOT научил ИИ-агентов исправляться прямо во время работы

PILOT научил ИИ-агентов исправляться прямо во время работы

Большинство методов самоулучшения ИИ-агентов разбирают накопленный опыт только после завершения запуска: они не могут ни перенаправить уже идущий прогон, ни сразу применить и проверить извлечённый урок. Авторы работы утверждают, что самоулучшение должно быть «живым», использовать опыт, возникающий по ходу дела, одновременно для коррекции текущего прогона и для обновления самого механизма (harness), которым агент пользуется постоянно.

По их доводам, существующие архитектуры агентов не решают эту задачу целиком. Если агент сам себя проверяет в рамках одного контекста (self-correction), выполнение задачи и оценка траектории смешиваются. Если работа делегируется отдельному подагенту, выполнение отделено от контроля, но перенаправить уже работающего подагента обычно нельзя.

Для этого авторы предложили PILOT, архитектуру «супервизор-работник» для живого самоулучшения, построенную на двух связанных механизмах: (1) живое управление (live steering), когда отдельный супервизор может перенаправить или прервать работающего работника прямо во время выполнения задачи, и (2) живая самоэволюция (live self-evolution), которая по ходу выполнения превращает выявленные приёмы и типичные сбои в переиспользуемые навыки и записи в памяти.

В тестах на двух зафиксированных базовых моделях и трёх бенчмарках PILOT заняла первое место в пяти конфигурациях из шести. На бенчмарке Terminal-Bench 2.0 PILOT обошла аналогичные архитектуры-«упряжи» максимум на 9,8 процентного пункта. В режиме самоулучшения PILOT показала прирост в 14,6 балла на базовой модели GLM-5.1 и 12,4 балла на Kimi-K2.6. При этом среднее число выходных токенов упало на 42,9% и 47,4%, а число успешных прогонов на миллион выходных токенов выросло на 110,3% и 134,0%, источник не уточняет прямо, к какой из двух моделей относится каждая из этих цифр, лишь порядок перечисления совпадает с порядком моделей в предыдущем предложении.

Ключевые факты

  • PILOT, архитектура «супервизор-работник» для живого самоулучшения ИИ-агентов прямо во время выполнения длинных задач, а не только после их завершения
  • Два механизма: live steering (супервизор перенаправляет или прерывает работника на лету) и live self-evolution (найденные приёмы и сбои сразу становятся переиспользуемыми навыками и записями в памяти)
  • На двух базовых моделях и трёх бенчмарках PILOT заняла первое место в 5 из 6 конфигураций; на Terminal-Bench 2.0 обошла аналоги максимум на 9,8 процентного пункта
  • В режиме самоулучшения прирост составил 14,6 балла на GLM-5.1 и 12,4 балла на Kimi-K2.6
  • Среднее число выходных токенов упало на 42,9% и 47,4%, а число успешных прогонов на миллион токенов выросло на 110,3% и 134,0%

Почему это важно

Большинство подходов к самоулучшению агентов работают постфактум: сначала прогон завершается, потом кто-то (или что-то) разбирает, что пошло не так. PILOT предлагает разорвать эту последовательность, супервизор видит происходящее в реальном времени и может вмешаться до того, как ошибка станет дорогой, а извлечённый урок сразу становится частью постоянного механизма агента, а не разовой правкой одного прогона.

Кому это важно

Разработчикам агентных систем и «упряжей» (harness) на базе больших языковых моделей, которые строят автономных агентов для длинных многошаговых задач, от работы в терминале до сложных исследовательских или инженерных сценариев, где ошибка на середине пути дорого стоит, если её некому вовремя перехватить.

Как это применить

Идея разделения ролей, отдельный супервизор, который наблюдает и может остановить или перенаправить работающего исполнителя, плюс отдельный механизм, превращающий опыт прогона в переиспользуемые навыки, применима как шаблон при проектировании собственных агентных систем поверх любой базовой модели. В тексте источника не сообщается о выпуске кода, данных или готовой модели PILOT.

Можно ли доверять

Работа опирается на количественное сравнение на трёх бенчмарках и двух базовых моделях (GLM-5.1 и Kimi-K2.6) с конкретными цифрами прироста, а не только на качественные заявления. При этом в тексте не названы ни авторы поимённо, ни конкретные архитектуры-конкуренты, с которыми сравнивали PILOT на Terminal-Bench 2.0, ни все три использованных бенчмарка, это ограничивает независимую проверку результатов по одному лишь тексту.

Риски и подводные камни

Результаты получены на двух конкретных базовых моделях (GLM-5.1 и Kimi-K2.6), и неясно, насколько выигрыш переносится на другие модели. Названия бенчмарков и «упряжей»-конкурентов в тексте не раскрыты, что мешает воспроизвести сравнение независимо. Кроме того, источник не уточняет прямо, какая доля прироста по токенам и эффективности относится к какой именно модели, совпадение порядка цифр с порядком моделей не гарантирует такого сопоставления.