Agentic ESOpt: эволюционные стратегии вместо RL дообучают ИИ-агентов с минимумом GPU-памяти

Agentic ESOpt: эволюционные стратегии вместо RL дообучают ИИ-агентов с минимумом GPU-памяти

Zhi Zheng с соавторами представили Agentic ESOpt, фреймворк полнопараметрического дообучения ИИ-агентов, рассчитанных на длинные цепочки шагов (long-horizon), на основе эволюционных стратегий (ES) вместо обучения с подкреплением (RL). Авторы аргументируют выбор так: обучение с подкреплением хорошо работает для однократных (single-turn) задач дообучения, но в длинных агентных сценариях с ветвящимися взаимодействиями и редкой наградой у него проявляются два слабых места, тяжёлый стек обучения на основе обратного распространения ошибки (backpropagation) делает дообучение крупных моделей непрактичным, а с ростом длины траектории определение вклада отдельных шагов в итоговую награду (credit assignment) становится заметно сложнее.

По утверждению авторов, эволюционные стратегии дают перед RL три преимущества. Во-первых, масштабируемость по размеру модели: ES позволяет полнопараметрическую оптимизацию, требуя лишь минимальной GPU-памяти, на уровне обычного инференса, что делает возможным дообучение крупных LLM. Во-вторых, гибкость: лёгкий интерфейс обратной связи по принципу «чёрного ящика» легко сочетается с эволюцией в пространстве промптов, например, с оптимизацией навыков и вычислениями на этапе вывода (test-time compute). В-третьих, масштабируемость по горизонту: ES приписывает вклад параметрам на уровне всей траектории целиком, не разбивая награду по отдельным шагам, и за счёт этого лучше масштабируется, чем агентный RL, по мере роста длины горизонта.

На основе этих доводов авторы предлагают сам метод, Agentic ESOpt, фреймворк для полнопараметрического дообучения агентов, заточенный под гибкую совместную эволюцию параметров модели и контекста. На каждом шаге Agentic ESOpt сэмплирует возмущения вокруг текущих параметров LLM, оценивает получившихся агентов по награде и применяет онлайн-обновление, взвешенное по этой награде. Чтобы улучшить баланс между исследованием пространства решений и адаптацией, метод дополнительно использует расписание косинусного затухания для масштаба возмущений σ (сигма).

В экспериментах на бенчмарке WebArena-Lite полнопараметрическая настройка модели Qwen-3.5-27B через Agentic ESOpt дала относительное улучшение на 6,69% по сравнению с базовым вариантом без обучения навыкам (No Skill baseline). В задаче автоматического подбора эвристик на этапе вывода (test-time automatic heuristic design) Agentic ESOpt выполняет совместную онлайн-эволюцию промпта и параметров и улучшает сравниваемый базовый вариант в 28 из 36 настроек.

Ключевые факты

  • Zhi Zheng с соавторами предложили Agentic ESOpt, фреймворк полнопараметрического дообучения длинногоризонтных ИИ-агентов на основе эволюционных стратегий (ES) вместо обучения с подкреплением (RL).
  • Аргумент авторов: тяжёлый бэкпроп-стек RL делает дообучение крупных моделей непрактичным, а с ростом длины траектории определение вклада отдельных шагов в награду становится намного сложнее.
  • По заявлению авторов, у ES три преимущества перед RL: нужна лишь GPU-память уровня инференса, лёгкая совместимость с эволюцией промптов, и приписывание вклада параметрам сразу по всей траектории, а не по шагам.
  • На WebArena-Lite полнопараметрическая настройка Qwen-3.5-27B через Agentic ESOpt дала относительное улучшение на 6,69% против базового варианта без обучения навыкам (No Skill).
  • В задаче автоматического подбора эвристик на этапе вывода Agentic ESOpt улучшил сравниваемый базовый вариант в 28 из 36 настроек за счёт совместной эволюции промпта и параметров.

Почему это важно

Обучение с подкреплением, стандартный способ дообучать ИИ-агентов, но авторы указывают на его слабое место именно в длинных, многошаговых сценариях: тяжёлый стек обучения на обратном распространении ошибки не масштабируется на крупные модели, а с ростом числа шагов становится всё труднее понять, какой именно шаг траектории заслужил награду. Работа предлагает эволюционные стратегии как альтернативу, которая, по утверждению авторов, обходит оба ограничения за счёт другого способа оптимизации, без обратного распространения ошибки и без разбиения награды по шагам.

Кому это важно

Команды, которые дообучают крупные LLM под роль автономных агентов (веб-агенты, агенты с длинными цепочками действий) и упираются в GPU-бюджет полноценного RL-дообучения. Метод из статьи нацелен именно на случай, когда полнопараметрическое дообучение крупной модели с бэкпропом непозволительно дорого по памяти.

Как это применить

Agentic ESOpt на каждом шаге сэмплирует случайные возмущения вокруг текущих параметров модели, прогоняет получившихся агентов и оценивает их по награде, затем обновляет параметры взвешенно по этой награде, без обратного распространения ошибки, то есть с памятью на уровне обычного инференса. Масштаб возмущений σ уменьшается по расписанию косинусного затухания, чтобы сначала шире исследовать пространство решений, а затем точнее его дорабатывать. Лёгкий интерфейс обратной связи по принципу «чёрного ящика» позволяет сочетать это с эволюцией самих промптов, например, с оптимизацией навыков агента.

Можно ли доверять

Материал, препринт на HuggingFace Papers, статус рецензирования не указан. Результаты приведены только на двух собственных сценариях авторов, бенчмарке WebArena-Lite и задаче автоматического подбора эвристик, а количественного сравнения с RL-базовыми методами или другими вариантами ES в источнике нет: единственная опорная точка сравнения, вариант без обучения навыкам (No Skill baseline).

Риски и подводные камни

Несмотря на то что экономия GPU-памяти, центральный заявленный довод работы, в источнике нет ни одной цифры по фактическому расходу вычислений: не указаны ни время обучения, ни число GPU, ни затраты по часам. Заявленное относительное улучшение на 6,69% и успех в 28 из 36 настроек показаны на ограниченном наборе задач, и насколько метод переносится на другие типы длинногоризонтных агентных сценариев, из текста не следует.