EnvACE: агентов ИИ научили «репетировать мир» вместо обучения на реальной среде

Zishan Xu с соавторами предложили метод обучения ИИ-агентов с подкреплением под названием EnvACE. Обычно для обучения агентов на базе языковых моделей долгим цепочкам вызовов инструментов нужна настоящая или синтетическая исполняемая среда, её построение и проверка дорого стоят, либо внешние симуляторы, которые сложно привязать к реальности. EnvACE заменяет это взаимодействие «репетицией мира»: одна и та же политика (модель) поочерёдно выступает то агентом, то средой. Сначала она генерирует вызов инструмента, затем сама же «играет роль» среды и придумывает отклик, который эта команда должна была бы вызвать, и уже на основе этого выдуманного отклика принимает следующее решение. Обе роли, действие и репетиция среды, обучаются совместно, из конца в конец, на награде за успешное выполнение задачи. За счёт такой репетиции политика встраивает в свои параметры связь между действиями и реакциями среды на них, по сути получается собственная «модель мира» агента, которая напрямую помогает принимать решения. Авторы протестировали EnvACE на четырёх бенчмарках агентного поведения, BFCL-v4, tau²-Bench, VitaBench и FinMCP-Bench, и утверждают, что метод показывает сильные и переносимые результаты, превосходя базовые подходы, которые вместо этого масштабируют число реальных сред. Дополнительные контролируемые эксперименты показывают, что репетиция мира стабильно улучшает обучение политики на моделях разного размера. Уже после обучения, во время работы агента, встроенная модель мира позволяет ему проводить «приватную репетицию» перед тем, как реально выполнить действие, при умеренном бюджете на такие репетиции это даёт дополнительный прирост качества без обращения к внешней среде. Авторы называют репетицию мира новым путём масштабирования обучения ИИ-агентов за пределами того, что позволяют внешние среды. Код метода выложен в открытый доступ на GitHub.
Ключевые факты
- EnvACE обучает агентов на базе языковых моделей без реальной или симулированной внешней среды, модель сама играет роль среды и генерирует отклики на собственные действия
- Модель поочерёдно выступает то агентом (генерирует вызов инструмента), то средой (придумывает отклик на этот вызов); обе роли обучаются совместно на награде за успех задачи
- В результате обучения политика получает встроенную «модель мира», она помогает принимать решения и позволяет проводить приватную репетицию перед реальным действием
- Метод протестирован на четырёх агентных бенчмарках, BFCL-v4, tau²-Bench, VitaBench и FinMCP-Bench, и, по утверждению авторов, превосходит подходы, масштабирующие число реальных сред
- Код EnvACE выложен в открытый доступ на GitHub
Почему это важно
Обучение ИИ-агентов взаимодействию с инструментами и внешним миром сегодня упирается в дорогую инфраструктуру: нужна либо настоящая, либо синтезированная исполняемая среда, которую надо построить и проверить, либо внешний симулятор, плохо привязанный к реальности. EnvACE предлагает обойтись без внешней среды вовсе, модель обучается репетировать реакцию среды внутри себя. Если подход подтвердится на практике, это снимает часть инфраструктурных издержек, которые сегодня сдерживают масштабирование обучения агентов.
Кому это важно
Прежде всего исследователям и инженерам, которые занимаются обучением с подкреплением для ИИ-агентов, работающих с инструментами и API, это ровно та задача, для которой строятся бенчмарки BFCL-v4, tau²-Bench, VitaBench и FinMCP-Bench. Метод также интересен командам, которые упираются в стоимость и сложность построения тренировочных сред для агентных систем.
Как это применить
Идея реализуется как единая политика с двумя ролями. На каждом шаге модель сначала действует, генерирует вызов инструмента, затем переключается в роль среды и сама придумывает отклик на этот вызов, после чего принимает следующее решение уже с оглядкой на этот придуманный отклик. Обе роли настраиваются совместно на награде за итоговый успех задачи. После обучения та же встроенная модель мира используется и во время реальной работы агента: перед тем как реально выполнить действие, агент может «прорепетировать» его при умеренном бюджете репетиций и за счёт этого получить дополнительный прирост качества. Код метода авторы выложили в открытом доступе на GitHub, что позволяет воспроизвести и проверить подход самостоятельно.
Можно ли доверять
Материал, это препринт исследовательской работы, опубликованный на HuggingFace Papers, то есть без подтверждённого прохождения рецензирования. В самом тексте аннотации нет конкретных числовых результатов, приростов точности или очков, по каждому из четырёх бенчмарков, только общее утверждение о превосходстве над подходами, масштабирующими реальные среды; оценить величину эффекта по одной аннотации нельзя. В плюс идёт то, что авторы выложили код в открытый доступ, это позволяет независимо проверить заявленные результаты.
Риски и подводные камни
Ключевой риск метода в его собственной конструкции: среда, на отклики которой обучается агент, не настоящая, а придуманная той же моделью, поэтому есть шанс, что политика обучится подстраиваться под собственные иллюзорные предсказания среды, а не под реальное поведение внешнего мира. Аннотация не называет конкретных цифр по бенчмаркам и не раскрывает, что именно считается «умеренным бюджетом» репетиций на этапе применения, по одному тексту препринта сложно судить, насколько устойчив выигрыш метода и при каких условиях он сохраняется.