Agent-G²: гауссова глубина подсказки повысила результаты ИИ-агентов

Agent-G²: гауссова глубина подсказки повысила результаты ИИ-агентов

В обучении ИИ-агентов с подкреплением на длинных многошаговых задачах (например, действия в виртуальном доме или покупки на сайте) награда встречается редко, и агенту трудно нащупать успешную стратегию с нуля. Один из способов справиться с этим, обучение с подсказками (hint-based RL): перед каждым прогоном агенту оставляют начальный отрезок («префикс») траектории эксперта, и он стартует не с нуля, а из состояния, уже более близкого к успеху. Насколько это работает, зависит от «глубины подсказки», сколько именно шагов экспертной траектории оставить агенту. До сих пор эту глубину задавали как одно жёсткое число: одни методы используют общий график, единый для всех задач и не учитывающий, что задачи разной сложности требуют разной подсказки; другие меряют глубину отдельно для каждого образца, но это требует дополнительных пробных прогонов и удорожает обучение. Авторы обнаружили, что полезная глубина подсказки, это не одна точная точка, а целая полоса значений, и то, насколько подсказка помогает, распределено по этой полосе примерно по гауссовой кривой вокруг её центра. На основе этой находки предложен метод Agent-G² (Gaussian Guidance): для каждой задачи глубина подсказки берётся не как фиксированное число, а как случайное значение из гауссова распределения, чьи центр и разброс (ширина) оцениваются онлайн, прямо по тем прогонам, которые агент и так делает в ходе обычного обучения политики, без отдельных пробных запусков и без обучения специального предсказателя глубины. Центр распределения складывается из общей базовой оценки и поправки на сложность кластера похожих задач, а разброс отслеживает, насколько сильно варьируется сложность внутри такого кластера. Метод проверили на двух бенчмарках агентных задач, ALFWorld (выполнение бытовых поручений в симуляции дома) и WebShop (покупки на сайте-имитаторе интернет-магазина), с моделями Qwen2.5 размером 1,5 и 7 миллиардов параметров в роли агента. На ALFWorld Agent-G² обошёл лучшие альтернативы каждого из трёх типов, методы с подсказками, методы без подсказок и вспомогательные RL-методы (Aux-RL), на 2,3, 3,9 и 7,4 пункта соответственно, при этом потратив на прогоны меньше трети того, что требует поточечное пробное зондирование глубины. Численных результатов по WebShop в тексте не приведено, хотя бенчмарк заявлен как часть проверки.

Ключевые факты

  • Проблема: в обучении с подсказками агенту перед прогоном оставляют отрезок экспертной траектории, но насколько его оставить («глубина подсказки»), раньше задавали либо одним общим числом на все задачи, либо мерили отдельно для каждой ценой лишних прогонов.
  • Находка: полезная глубина подсказки, не одна точка, а полоса значений, чья полезность распределена примерно по Гауссу вокруг центра этой полосы.
  • Метод Agent-G² берёт глубину подсказки для каждой задачи из гауссова распределения, чьи центр и разброс считаются онлайн по уже идущим прогонам обучения, без отдельного зондирования и без обучаемого предсказателя глубины.
  • Центр распределения = общая базовая оценка + поправка на сложность кластера задач; разброс отслеживает вариацию сложности внутри кластера.
  • На ALFWorld (модели Qwen2.5-1,5B/7B-Instruct) Agent-G² обошёл лучшие методы с подсказками, без подсказок и Aux-RL на 2,3 / 3,9 / 7,4 пункта соответственно, потратив менее трети прогонов относительно поточечного зондирования; результатов по WebShop в тексте нет.

Почему это важно

Работа переосмысливает саму постановку задачи: вместо того чтобы искать одно «правильное» число для глубины подсказки, авторы показывают, что полезность подсказки распределена по целой полосе значений примерно как гауссова кривая. Это снимает вилку между двумя прежними подходами, грубым единым графиком глубины на все задачи и точным, но дорогим поточечным зондированием каждой задачи отдельно: Agent-G² получает выгоды точной настройки, оценивая распределение глубины прямо по тем прогонам, что агент и так делает во время обучения, без дополнительных затрат.

Кому это важно

Метод адресован тем, кто обучает ИИ-агентов с подкреплением на длинных многошаговых задачах с редкой наградой, навигация по вебу, выполнение поручений в симулированной среде, использование инструментов агентом. Особенно полезен командам, где важна эффективность по числу прогонов: Agent-G² не требует ни отдельных пробных запусков, ни обучения дополнительной сети-предсказателя.

Как это применить

Agent-G² встраивается в обучение политики как надстройка над hint-based RL: центр и разброс гауссова распределения глубины подсказки пересчитываются онлайн из уже собранных для оптимизации политики прогонов, без отдельной фазы зондирования. Центр = глобальная базовая оценка + поправка на сложность кластера похожих задач, разброс = дисперсия сложности внутри кластера. Метод проверен с моделями-агентами Qwen2.5-1,5B и Qwen2.5-7B-Instruct на бенчмарках ALFWorld и WebShop.

Можно ли доверять

Текст источника, это описание метода и результатов на странице статьи (полный текст доступен), но в нём нет имён авторов, аффилиаций, места и даты публикации. Числовые результаты приведены только для ALFWorld и только как относительный отрыв от базовых методов (в пунктах), без абсолютных показателей; для WebShop, хотя он заявлен как один из двух бенчмарков проверки, никаких числовых результатов в тексте не приведено. Публикация получила скромный отклик на Hugging Face, 16 очков и один комментарий.

Риски и подводные камни

Заявленное превосходство подтверждено только на одном из двух заявленных бенчмарков (ALFWorld) и только для двух размеров модели (1,5 и 7 млрд параметров) одного семейства (Qwen2.5), обобщаемость на другие среды, задачи и модели по тексту не проверить. Отсутствие результатов по WebShop в источнике не позволяет судить, работает ли метод так же хорошо за пределами ALFWorld. Само допущение о примерно гауссовой форме полезности подсказки, эмпирическая находка авторов, а не доказанное свойство, и может не выполняться для задач другой природы.