FlowEvo научил ИИ-агентов превращать удачные сценарии в переиспользуемые навыки

Zeyu Ren с соавторами представили FlowEvo, фреймворк, который не требует дополнительного дообучения модели и заставляет параллельно совершенствоваться два элемента системы агента: сценарии действий (последовательности шагов, которые агент строит для решения задачи) и переиспользуемые навыки, которые из этих сценариев получаются. Обычно, когда ИИ-агент на лету собирает удачную последовательность действий, эта находка теряется сразу после выполнения задачи, при следующей похожей задаче агент собирает всё заново, тратя на это лишние токены. FlowEvo решает именно эту проблему.
Механизм такой: как только агент строит удачный сценарий, FlowEvo компилирует его в вызываемый навык и сохраняет в постоянном банке навыков. При следующей похожей задаче агент может либо сразу выполнить сохранённый навык, либо использовать его как подсказку при построении нового сценария. Отдельно система отслеживает практическую пользу каждого навыка и отключает те навыки, которые начинают ухудшать результат, это явление называют отрицательным переносом.
В сравнении с восемью другими методами на полных стандартных наборах тестов ALFWorld, HumanEval, MBPP, GSM8K и MATH-500, все эксперименты проведены на общей базовой модели GPT-4o-mini, FlowEvo показал самую высокую точность. На тесте ALFWorld фреймворк достиг точности 85,6%, это на 26,4 процентного пункта выше сильнейшего из методов сравнения, при этом FlowEvo потратил лишь около трети токенов этого метода. В отдельном эксперименте на 10 разных базовых моделях размером от 7 до 671 миллиарда параметров FlowEvo обошёл метод ExpeL в 49 из 50 комбинаций «модель + датасет».
Аннотация работы не называет ни авторские аффилиации, ни дату публикации, не уточняет, какой именно метод оказался «сильнейшим» на ALFWorld, не описывает, как именно определяется отрицательный перенос и измеряется полезность навыка, и не поясняет, входит ли GPT-4o-mini в число тех 10 моделей, что использовались в сравнении с ExpeL. Код FlowEvo выложен в открытом доступе на GitHub.
Ключевые факты
- FlowEvo, фреймворк без дополнительного дообучения модели: сценарии действий агента и навыки, которые из них получаются, совершенствуются параллельно прямо в процессе решения задач.
- Удачный сценарий FlowEvo компилирует в вызываемый навык и кладёт в постоянный банк навыков; при похожей задаче агент либо сразу выполняет сохранённый навык, либо использует его как подсказку при построении нового сценария.
- Отдельный механизм отслеживает практическую пользу каждого навыка и отключает те, что начинают вредить результату (отрицательный перенос).
- На общей базовой модели GPT-4o-mini FlowEvo обошёл восемь других методов на тестах ALFWorld, HumanEval, MBPP, GSM8K и MATH-500; на ALFWorld, точность 85,6% (на 26,4 п.п. выше сильнейшего конкурента), при этом потрачено лишь около трети токенов этого конкурента.
- На 10 разных базовых моделях (от 7 до 671 миллиарда параметров) FlowEvo обошёл метод ExpeL в 49 из 50 сочетаний «модель + датасет»; код опубликован на GitHub.
Почему это важно
Агенты на основе языковых моделей обычно строят сценарий действий для задачи на лету, но как только задача решена, эта находка чаще всего теряется: при следующей похожей задаче агент собирает всё заново, тратя на это токены и время. Существующие библиотеки навыков решают проблему лишь частично: они собираются заранее, офлайн, и не растут из опыта самого агента. FlowEvo снимает оба ограничения без дополнительного дообучения модели, превращает каждый удачный сценарий в переиспользуемый навык и одновременно отслеживает, какие из накопленных навыков реально помогают, а какие начинают вредить результату, так библиотека навыков не превращается в свалку.
Кому это важно
Разработчикам автономных ИИ-агентов, систем для многошаговых задач вроде управления окружением (как в тесте ALFWorld), написания и правки кода или решения математических задач, которым нужно, чтобы агент со временем работал точнее и дешевле без затрат на дообучение модели. Полезно и исследователям, изучающим накопление опыта и переиспользование навыков у агентов: FlowEvo напрямую сравнивается с методом ExpeL и проверен на 10 базовых моделях разного размера, от 7 до 671 миллиарда параметров, то есть подход не завязан на одну конкретную модель.
Как это применить
Поскольку FlowEvo не требует дообучения модели, его в теории можно подключить поверх уже существующей связки «агент + языковая модель» на уровне оркестрации: сохранять удачные сценарии как навыки в банке и подтягивать их на нужном шаге, либо выполняя навык напрямую, либо передавая его как подсказку при построении нового сценария. Код фреймворка выложен в открытом доступе на GitHub (репозиторий DEFENSE-SEU/FlowEvo), так что реализацию можно изучить и опробовать самостоятельно.
Можно ли доверять
Результаты выглядят основательно: сравнение против восьми методов на пяти стандартных наборах тестов и отдельная проверка на 10 базовых моделях разного размера против конкретного метода ExpeL, не единичный замер на одном бенчмарке. Но часть деталей аннотация не раскрывает: не названо, какой именно метод стал «сильнейшим» на ALFWorld, не описан механизм, которым определяется отрицательный перенос и измеряется полезность навыка, не указаны авторские аффилиации и дата публикации, и не уточнено, входит ли базовая модель GPT-4o-mini в число тех 10 моделей, что использовались в сравнении с ExpeL. Это самостоятельно заявленные авторами цифры без признаков независимой проверки на момент публикации.
Риски и подводные камни
Механизм подавления «вредных» навыков описан только на уровне идеи, без деталей о том, как именно он ловит отрицательный перенос, сложно оценить, насколько он надёжен на длинной дистанции: банк навыков может расти месяцами, и не ясно, не начнёт ли он засоряться неудачными решениями, которые система пропустит. Все цифры получены на пяти конкретных бенчмарках (ALFWorld, HumanEval, MBPP, GSM8K, MATH-500), перенос результата на более разнородные, нестандартные задачи вне этих бенчмарков не проверен. Основное сравнение с восемью методами прогнано только на одной базовой модели, GPT-4o-mini; сохранится ли выигрыш на других моделях, впрямую не показано, кросс-модельная проверка на 10 моделях сравнивает FlowEvo только с методом ExpeL, а не со всеми восемью методами сразу.