FlowEvo сохраняет исполнимые навыки ИИ-агентов без дообучения
FlowEvo, предложенная авторами система для агентов на базе больших языковых моделей. Такие агенты решают задачи, собирая во время выполнения рабочие процессы из рассуждений, вызовов инструментов и запуска кода, но найденные удачные процедуры обычно остаются только в рамках текущей задачи. FlowEvo без дообучения нейросети превращает успешные трассы выполнения в сохраняемые записи навыков.
Каждая запись связывает вызываемый исполнимый артефакт со вспомогательными структурированными инструкциями. Перед добавлением записи система, когда это возможно, проверяет интерфейс, повторное воспроизведение и безопасность. Навыки сохраняются в банке навыков и затем помогают решать следующие задачи: их можно либо выполнить напрямую, либо передать агенту как структурированный контекст. Отдельный механизм отслеживает полезность навыков в последующих задачах и подавляет те, которые ухудшают перенос на новые задачи.
Авторы описывают этот цикл как «рабочий процесс → навык → рабочий процесс»: успешные процедуры извлекаются из выполнения, а накопленные навыки участвуют в построении следующих решений. В тестах на интерактивной среде ALFWorld и задачах генерации кода и математики HumanEval и GSM8K FlowEvo, по данным авторов, показал лучшее среди проверенных базовых подходов соотношение точности и стоимости. В ALFWorld заявлена успешность 82,8%, на 23,6 процентного пункта выше сильнейшего базового подхода; среднее число токенов на эпизод при этом составляет менее половины от уровня наиболее экономичного базового подхода. Контролируемые абляции, как сообщается, подтверждают вклад каждого из трёх механизмов. Код опубликован на GitHub.
Ключевые факты
- FlowEvo компилирует успешные трассы выполнения агента в повторно используемые записи исполнимых навыков, не обновляя параметры нейросети.
- Запись навыка содержит вызываемый артефакт и структурированные инструкции; при добавлении проверяются интерфейс, воспроизводимость и безопасность, где это возможно.
- Накопленные навыки извлекаются для новых задач и используются прямым запуском либо как структурированный контекст.
- Система отслеживает пользу навыков в следующих задачах и подавляет те, что вызывают отрицательный перенос.
- В ALFWorld авторы заявляют 82,8% успешных эпизодов: на 23,6 процентного пункта выше сильнейшего базового подхода при среднем расходе токенов менее половины от наиболее экономичного базового подхода.
Почему это важно
Рабочие процессы агента часто находят полезные процедуры лишь на время одной задачи. FlowEvo предлагает сохранять эти процедуры как исполнимые навыки и возвращать их в новые рабочие процессы, чтобы способность решать задачи накапливалась без изменения параметров нейросети.
Кому это важно
Подход относится к разработчикам и исследователям ИИ-агентов, которые сочетают рассуждения, инструменты и выполнение кода. Авторы проверяли его на интерактивной среде ALFWorld, а также на HumanEval и GSM8K.
Как это применить
В предложенной схеме успешную трассу нужно превратить в вызываемый артефакт со структурированными инструкциями, проверить её и добавить в банк навыков. При следующей задаче навык извлекается для прямого выполнения или передачи агенту как контекст; код FlowEvo опубликован на GitHub.
Можно ли доверять
Это исследовательская работа с результатами в условиях реализации авторов. В ней приведены сравнения с базовыми подходами и контролируемые абляции, которые, по утверждению статьи, показывают вклад компиляции навыков, обратной связи навыков с рабочими процессами и отбора навыков.
Риски и подводные камни
Не всякий сохранённый навык полезен в новой задаче: статья прямо учитывает отрицательный перенос и предлагает подавлять такие навыки. Проверки интерфейса, воспроизводимости и безопасности выполняются лишь там, где это возможно, поэтому качество и безопасность записей требуют контроля.