AgentOPSD: новый метод обучения с подкреплением поднял успех ИИ-агента до 89,1%

AgentOPSD: новый метод обучения с подкреплением поднял успех ИИ-агента до 89,1%

Обучение с подкреплением с проверяемыми наградами обычно оценивает всю траекторию действий агента целиком, но такой подход плохо выделяет те несколько по-настоящему решающих шагов, от которых зависит исход длинных многоходовых агентных задач. Один из подходов к этой проблеме, «привилегированная самодистилляция» (privileged self-distillation), которая добавляет более плотный сигнал обучения, но остаётся неясным, как именно локальные сигналы должны отражать последовательную ответственность за результат.

Zi-Han Wang с соавторами предложили AgentOPSD, критик-независимый рекурсивный метод распределения ответственности по ходам (turn-level credit assignment) для агентного обучения с подкреплением. Метод собирает разницу логарифмов вероятностей между моделью-учителем и моделью-учеником на уровне токенов, превращает её в свидетельство на уровне отдельного хода и рекурсивно обновляет байесовское распределение убеждений в логарифмических шансах (log-odds). Это даёт схему перевзвешивания, которая превращает редкий сигнал об итоговом успехе задачи в сигналы ответственности для каждого хода и выявляет решающие ходы по величине пересмотра убеждений между соседними состояниями. AgentOPSD полностью совместим со стандартной оптимизацией политики и не требует ни дополнительной модели-критика, ни дополнительных прогонов (rollouts).

Метод проверили на трёх средах, ALFWorld, WebShop и Search-QA, с моделями Qwen2.5 двух размеров, 3B и 7B параметров. AgentOPSD превзошёл базовый метод GRPO и сильные методы самодистилляции: на ALFWorld с моделью Qwen2.5-7B доля успешно решённых задач достигла 89,1%. Численные результаты для WebShop и Search-QA, а также точные показатели GRPO в статье не приведены. Абляционные эксперименты (поочерёдное отключение частей метода) показали, что прирост дают именно пошаговая агрегация сигнала и рекурсивное обновление убеждений, учитывающее историю ходов.

Ключевые факты

  • AgentOPSD, критик-независимый рекурсивный метод распределения ответственности по ходам в агентном обучении с подкреплением.
  • Метод строит байесовское обновление убеждений в лог-шансах (log-odds) на основе разницы log-вероятностей между моделью-учителем и моделью-учеником.
  • На ALFWorld с Qwen2.5-7B достигнута точность 89,1% успешных решений, выше, чем у GRPO и методов самодистилляции.
  • Метод протестирован также на WebShop, Search-QA и модели Qwen2.5-3B, но численные результаты по ним в статье не приведены.
  • Абляции показывают, что прирост даёт именно пошаговая агрегация сигнала и рекурсивные обновления убеждений с учётом истории.

Почему это важно

В обучении с подкреплением с проверяемыми наградами агент обычно получает одну общую оценку на всю траекторию действий, успех или провал задачи целиком. Такой сигнал плохо указывает, какие именно из десятков ходов в длинной многоходовой задаче были решающими, а какие нейтральными. AgentOPSD решает именно эту проблему: превращает редкую итоговую награду в оценку ответственности для каждого отдельного хода, используя рекурсивное байесовское обновление вместо отдельной модели-критика.

Кому это важно

Метод адресован разработчикам и исследователям, которые обучают ИИ-агентов для многоходовых задач, управление веб-интерфейсами (как в WebShop), выполнение бытовых поручений в симуляции (ALFWorld) или поиск информации (Search-QA). Он полезен командам, у которых нет ресурсов на обучение и поддержку отдельной модели-критика, но которые хотят более точный сигнал обучения, чем даёт базовый GRPO.

Как это применить

AgentOPSD не требует ни дополнительной модели-критика, ни дополнительных прогонов среды (rollouts), он полностью совместим со стандартной оптимизацией политики и добавляется поверх существующего пайплайна обучения как способ пересчёта весов вознаграждения по ходам. Это снижает вычислительные и инженерные затраты по сравнению с методами, где критик обучается отдельно.

Можно ли доверять

Источник, препринт на Hugging Face Papers с полным текстом аннотации; статья описывает конкретную методику и воспроизводимые эксперименты на стандартных бенчмарках (ALFWorld, WebShop, Search-QA) с открытыми моделями Qwen2.5. При этом в тексте не указаны ни авторская аффилиация, ни место публикации, ни точные цифры для WebShop и Search-QA, ни собственный показатель GRPO, это не позволяет независимо оценить масштаб превосходства метода за пределами одной цифры по ALFWorld.

Риски и подводные камни

Единственный подробно приведённый результат, 89,1% на ALFWorld; для WebShop и Search-QA, где метод тоже тестировался, численные показатели в статье отсутствуют, что не даёт судить о согласованности выигрыша между средами. Результаты получены одной исследовательской группой без указания на независимое рецензирование, а масштаб моделей ограничен 3B и 7B параметрами, обобщение на более крупные модели и на задачи вне текстовых симулированных сред пока не проверено.