DRACO распределяет одну оценку по всем шагам обучения ИИ-агента

DRACO распределяет одну оценку по всем шагам обучения ИИ-агента

Исследователи предложили DRACO (Distributing Rubric-based Advantage for Credit Optimization), метод обучения ИИ-агентов с подкреплением для задач, где нет программного способа проверить успех автоматически. Обучение с проверяемыми наградами (RLVR) хорошо работает, когда есть чёткий чекер результата, но у большинства долгих многошаговых агентных задач такого чекера просто нет, авторы называют это "outcome-blind" постановкой, то есть без сигнала об истинном успехе. Популярная альтернатива, многокритериальные рубрики: агента оценивают набором критериев один раз по итогам всей попытки (траектории). Проблема в том, что для попытки из десятков шагов одно-единственное число, слишком грубый сигнал: непонятно, какие именно шаги были удачными, а какие нет.

DRACO решает эту проблему так: рубрики генерируются динамически прямо в процессе обучения, чтобы отслеживать, как меняются возможности обучаемой политики; каждая рубрика оценивается один раз по завершённой траектории; затем эта единая оценка перераспределяется по тем шагам, к которым относится конкретная рубрика, так получаются дифференцированные пошаговые оценки преимущества (advantage) внутри алгоритма GRPO. Перераспределение задаётся закрытой формулой (closed-form) и не требует отдельного обучаемого модуля, который бы "угадывал", какой шаг за что отвечает.

На бенчмарке AppWorld DRACO даёт прирост в 15,9 пункта относительно базовой модели и 5,3 пункта относительно GRPO, обученного на разреженной эталонной награде, и это притом что сам DRACO вообще не использует верификаторы. На внедоменном (out-of-domain) бенчмарке Tau-Bench метод даёт 5,3 пункта прироста относительно базовой модели даже без привлечения топовой модели-"судьи", обходя как обучение с эталонной наградой, так и другие подходы на основе рубрик. Код доступен в открытом репозитории github.com/IBM/draco.

Ключевые факты

  • Проблема: RL с проверяемыми наградами (RLVR) требует программного чекера успеха, а у большинства долгих агентных задач его нет, DRACO работает в "outcome-blind" сценарии, без эталонного сигнала успеха
  • Многокритериальные рубрики, популярный способ дать награду, но их оценивают один раз на всю траекторию, и одного числа мало на десятки шагов
  • DRACO генерирует рубрики динамически по ходу обучения, оценивает их один раз по завершённой траектории и закрытой формулой (без обучаемого модуля) перераспределяет оценку по шагам, получая дифференцированные пошаговые advantage внутри GRPO
  • На AppWorld: +15,9 пункта к базовой модели и +5,3 пункта к GRPO с разреженной эталонной наградой, без использования верификаторов
  • На внедоменном Tau-Bench: +5,3 пункта к базовой модели даже без модели-судьи, обходя и обучение с эталонной наградой, и другие подходы на основе рубрик; код открыт на GitHub (IBM/draco)

Почему это важно

Большинство реальных агентных задач, работа с API, инструментами, многошаговые сценарии, не имеют программного способа автоматически проверить, успешно ли агент справился. Обучать такие модели с подкреплением до сих пор означало либо использовать грубую единую оценку на всю попытку, либо вообще обходиться без сигнала. DRACO предлагает способ получить осмысленную пошаговую награду из одной-единственной оценки рубрики на всю траекторию, закрытой формулой, без дополнительного обучаемого компонента, это снимает конкретное узкое место в обучении длинных агентных сценариев с подкреплением.

Кому это важно

Разработчикам и исследователям, которые обучают LLM-агентов через reinforcement learning для многошаговых задач без готового автоматического проверяющего, например, для агентов, работающих с внешними API и инструментами (профиль задач AppWorld и Tau-Bench), где нельзя просто запрограммировать чекер успеха.

Как это применить

DRACO встраивается в существующий пайплайн обучения на GRPO: во время обучения динамически генерируются рубрики под текущий уровень политики, каждая рубрика оценивается один раз по завершённой траектории, а затем оценка перераспределяется по шагам через закрытую формулу, без обучения отдельного модуля атрибуции. Код метода опубликован в открытом доступе на GitHub (github.com/IBM/draco).

Можно ли доверять

Метод проверен на двух признанных бенчмарках для агентов, AppWorld и внедоменном Tau-Bench, и цифры прироста в обоих случаях приведены конкретно (15,9 и 5,3 пункта). Вместе с тем в тексте источника не названы авторы, а организация, IBM, видна лишь по адресу репозитория (github.com/IBM/draco); также не указаны объём вычислений, размер модели и дата публикации, это ограничивает возможность независимо оценить контекст и воспроизводимость результатов помимо опубликованного кода.

Риски и подводные камни

Закрытая формула перераспределения оценки опробована пока на двух бенчмарках, неясно, насколько она устойчива к другим типам задач и структурам рубрик. Качество итоговых пошаговых наград всё равно зависит от того, насколько хорошо динамически сгенерированные рубрики отражают реальный прогресс агента, а не искусственный прокси-критерий. Источник не раскрывает ни вычислительные затраты метода, ни то, как метод ведёт себя при увеличении длины траектории или размера рубрик.