GAGAR: агент-оценщик перераспределяет награду при обучении код-агентов

GAGAR: агент-оценщик перераспределяет награду при обучении код-агентов

При обучении код-агентов с подкреплением (RL) награду часто дают по результатам исполняемых тестов: тест пройден или нет. В такой схеме алгоритм GRPO (Group Relative Policy Optimization) назначает одинаковое преимущество (advantage) всем траекториям в группе прогонов, которые прошли тесты. Различия в качестве реализации и в том, насколько решение соответствует требованиям задачи, при этом теряются. По словам авторов, у политики нет сигнала, который поощрял бы аккуратные точечные правки и отличал бы их от решений с лишними или выходящими за рамки задачи изменениями.

Для этого предложен GAGAR, фреймворк для перераспределения награды с учётом качества. Он опирается на динамическую выборку, которая оставляет группы, где есть и прошедшие, и не прошедшие тесты траектории. Все траектории группы помещаются в общее рабочее пространство. Там агент-оценщик, обученный с помощью SFT (обучения на размеченных примерах), совместно просматривает их и ранжирует те, что прошли тесты.

По ранжированию решения с более низкими местами получают меньший вес, а преимущества всех прошедших тесты траекторий пропорционально масштабируются, чтобы их сумма осталась прежней. Такое перераспределение с сохранением суммы сохраняет относительные веса, заданные понижением по качеству, и при этом сдвигает награду к более качественным реализациям.

Метод оценивали в промышленном масштабе на контрольных точках после SFT и до RL моделей MiMo-V2.6-Flash (310 млрд параметров всего) и MiMo-V2.6-Pro (1,02 трлн параметров всего). В контролируемых экспериментах только на коде с моделью Flash авторы сообщают об улучшении работы код-агента, более медленном росте длины траекторий и более стабильном обучении. Затем GAGAR применили в крупном RL на смеси задач с обеими моделями, Flash и Pro. Авторы делают вывод, что результаты говорят в пользу сочетания проверки тестами с групповой оценкой агентом для качества и стабильности RL код-агентов.

Ключевые факты

  • Проблема: при бинарной награде за тесты GRPO даёт одинаковое преимущество всем траекториям группы, прошедшим тесты, и не отличает чистые решения от решений с лишними правками.
  • GAGAR: агент-оценщик (обучен с помощью SFT) совместно просматривает все траектории группы в общем рабочем пространстве и ранжирует те, что прошли тесты.
  • Решения с низким рангом получают меньший вес, а преимущества всех прошедших тесты траекторий пропорционально масштабируются, чтобы сумма осталась прежней.
  • Проверка на контрольных точках MiMo-V2.6-Flash (310 млрд параметров) и MiMo-V2.6-Pro (1,02 трлн параметров).
  • По заявлению авторов, в опытах только на коде с Flash выросло качество работы код-агента, медленнее растёт длина траекторий, обучение стабильнее; числовых результатов в тексте нет.

Почему это важно

Тесты, самый распространённый и дешёвый способ проверить работу код-агента, но бинарный сигнал «прошёл или нет» не различает качество решений. Агент, который добавил лишние или не относящиеся к задаче правки, получает ту же награду, что и агент с аккуратной точечной реализацией. GAGAR пытается добавить в обучение сигнал качества, не отказываясь от проверки тестами. Заявленный эффект, не только лучшая работа агента, но и меньший рост длины траекторий и более стабильное обучение.

Кому это важно

Прежде всего командам, которые обучают код-агентов с подкреплением и используют GRPO с наградой за прохождение тестов. Работа также интересна тем, кто строит системы оценки качества кода с помощью агентов, и исследователям, изучающим устойчивость RL на больших моделях: эксперименты проведены на моделях с 310 млрд и 1,02 трлн параметров.

Как это применить

В описании изложена схема: оставлять группы со смешанным исходом, собирать траектории в общем рабочем пространстве, ранжировать прошедшие тесты решения агентом-оценщиком, понижать вес нижних и пропорционально масштабировать преимущества, чтобы сумма не менялась. В тексте не названы размер, базовая модель и обучающие данные оценщика, а о выпуске кода или моделей не сообщается, так что воспроизвести метод по этому описанию полностью не получится.

Можно ли доверять

Это описание научной работы на странице Hugging Face Papers; все утверждения об эффекте принадлежат самим авторам. Улучшения названы только качественно: названий бенчмарков и числовых результатов в тексте нет. Контролируемые эксперименты описаны лишь для кода и только для модели Flash, результаты смешанного RL с Flash и Pro не раскрыты. Авторы и организации в тексте не указаны.

Риски и подводные камни

Оценка качества отдана агенту-оценщику, обученному с помощью SFT, поэтому итог зависит от его суждений; как его проверяли, в тексте не сказано. Без чисел трудно судить, насколько велик эффект. Метод предполагает дополнительные вычисления на просмотр всех траекторий каждой группы, но в тексте стоимость не обсуждается. Результаты для Pro в контролируемой постановке не описаны.