Предложен CorrGRPO: вариант GRPO для обучения с несколькими наградами

Group Relative Policy Optimization (GRPO) широко применяют для обучения рассуждающих языковых моделей. Метод считает преимущества (advantages), центрируя и нормируя награды по нескольким прогонам (rollouts) для одного и того же запроса. Если наград несколько, GRPO складывает их компоненты и нормирует суммарную награду на её стандартное отклонение внутри группы.
Дисперсия суммарной награды равна сумме всех попарных ковариаций наград. Поэтому при фиксированной центрированной награде большая суммарная ковариация даёт меньшие преимущества, и наоборот: величина обновления подстраивается под зависимость между наградами. Но у такой схемы есть слабое место: коррелирующие награды с большим масштабом могут доминировать в нормировке и подавлять сигнал от наград меньшего масштаба.
Авторы предлагают Correlation-Normalized GRPO (CorrGRPO). Он нормирует попарные ковариации в коэффициенты корреляции Пирсона. Центрированная суммарная награда при этом остаётся прежней, а влияние наград разного масштаба на нормировку на основе корреляций выравнивается. Величина преимуществ по-прежнему адаптируется к корреляциям между наградами, но нормировка не определяется компонентами с крупным масштабом.
CorrGRPO сравнивают с GRPO и другими вариантами на трёх задачах: генерация кода, вызов инструментов и безопасность агентов. Модели в экспериментах, от 0,5 млрд до 8 млрд параметров. Во всех этих задачах несколько наград, которые могут расти вместе или вступать в компромисс друг с другом. По заявлению авторов, результаты показывают улучшения во всех трёх областях. Код опубликован на GitHub в организации HKUST-KnowComp.
Ключевые факты
- GRPO при нескольких наградах суммирует их и нормирует сумму на стандартное отклонение внутри группы; дисперсия суммы равна сумме попарных ковариаций.
- Проблема: коррелирующие награды с большим масштабом могут доминировать в нормировке и подавлять сигнал наград меньшего масштаба.
- CorrGRPO нормирует попарные ковариации в коэффициенты корреляции Пирсона, не меняя центрированную суммарную награду.
- Сравнение с GRPO и другими вариантами: генерация кода, вызов инструментов, безопасность агентов; модели от 0,5B до 8B параметров.
- Авторы сообщают об улучшениях в трёх областях; код опубликован на GitHub (HKUST-KnowComp/CorrGRPO).
Почему это важно
Обучение с подкреплением на нескольких наградах сразу, обычная ситуация для рассуждающих моделей и агентов: нужно одновременно ценить, например, корректность и безопасность. Работа указывает на конкретный изъян стандартной нормировки в GRPO: награды с крупным масштабом и взаимной корреляцией заглушают более мелкие сигналы. CorrGRPO предлагает исправление, которое не меняет центрированную суммарную награду, а меняет только способ нормировки.
Кому это важно
Прежде всего тем, кто дообучает языковые модели методом GRPO с составной наградой: исследователям обучения с подкреплением и командам, которые тренируют модели для генерации кода, вызова инструментов и защищённых агентов. Остальным читателям это скорее сигнал о направлении развития GRPO-подобных методов.
Как это применить
Код CorrGRPO опубликован на GitHub в организации HKUST-KnowComp (репозиторий CorrGRPO). Практический ориентир из аннотации: метод рассчитан на задачи, где несколько наград могут улучшаться вместе или вступать в компромисс. Требований к вычислительным ресурсам и рекомендаций по настройке в тексте источника нет.
Можно ли доверять
Источник, аннотация статьи, и все утверждения принадлежат авторам. В ней не названы конкретные тесты, наборы данных и модели, нет численных результатов: размер улучшений, показатели базовых методов и статистическая значимость не указаны. Другие варианты GRPO, с которыми сравнивали метод, тоже не названы. Заявление об улучшениях в трёх областях стоит проверять по полному тексту статьи и коду.
Риски и подводные камни
По аннотации нельзя оценить масштаб выигрыша и то, насколько он устойчив. Не указаны вычислительные затраты и накладные расходы CorrGRPO относительно GRPO. Не сказано, какие размеры моделей использовались в каких задачах, поэтому перенос результатов на другие модели и задачи нужно проверять отдельно.