Исследователи представили GEPO, улучшение GRPO для RL-обучения ИИ на разнородных задачах

Исследователи представили GEPO, улучшение GRPO для RL-обучения ИИ на разнородных задачах

Группа исследователей во главе с Гуанраном Чэном опубликовала работу «Group Entropy-Controlled Policy Optimization» (GEPO), новый метод обучения с подкреплением (RL) для больших языковых моделей, построенный как облегчённое расширение популярного алгоритма GRPO.

Авторы отталкиваются от проблемы: контроль энтропии, стандартный инструмент RL-выравнивания языковых моделей, который помогает балансировать компромисс между исследованием новых решений и использованием уже найденных (exploration-exploitation). Но на практике обучение обычно идёт на смеси разнородных задач, математика, код, инструкции и другие, и одна и та же модель демонстрирует разные режимы энтропии в зависимости от типа задачи. Единая глобальная или токенная регулировка энтропии этого разброса не учитывает. Более того, из-за такой разнородности нормализация преимуществ (advantage), принятая в GRPO, вносит зависящее от энтропии смещение: сигналы advantage из разных групп запросов становятся статистически несравнимыми между собой, что мешает корректному обучению.

GEPO решает эту проблему за счёт групповой энтропии: она оценивается по уже имеющимся сгруппированным сэмплам (без дополнительных вычислений с нуля) и используется для асимметричной корректировки advantage. В группах с низкой энтропией GEPO ослабляет положительные advantage, это снижает риск чрезмерной эксплуатации уже известных решений. В группах с высокой энтропией метод ослабляет отрицательные advantage, так сохраняется пространство для исследования новых вариантов. Пороги для этой корректировки не фиксированы заранее, а адаптивно выводятся из исторической статистики энтропии в ходе обучения.

Авторы проверили GEPO на двух базовых моделях и тринадцати бенчмарках, охватывающих математику, физику, естественные науки, генерацию кода и следование инструкциям. По их результатам, GEPO стабильно превосходит и стандартный GRPO, и другие недавние методы контроля энтропии: метод даёт сбалансированный прирост качества сразу по всем типам задач, при этом сохраняя специфичный для каждой задачи уровень исследования на протяжении всего обучения.

Ключевые факты

  • GEPO, облегчённое расширение алгоритма GRPO, которое использует энтропию внутри каждой группы сэмплов для более точного RL-обучения языковых моделей
  • Проблема: при обучении на смеси разнородных задач энтропия сильно различается между группами, а глобальная/токенная регулировка это не учитывает; из-за нормализации advantage в GRPO сигналы становятся статистически несравнимыми между группами задач
  • Решение: GEPO ослабляет положительные advantage в группах с низкой энтропией (против переэксплуатации известных решений) и ослабляет отрицательные advantage в группах с высокой энтропией (чтобы сохранить исследование); пороги адаптивно выводятся из истории энтропии
  • Метод проверен на двух базовых моделях и 13 бенчмарках по математике, физике, естественным наукам, генерации кода и следованию инструкциям
  • GEPO стабильно превосходит GRPO и другие недавние методы контроля энтропии, давая сбалансированный прирост по всем типам задач без потери способности к исследованию

Почему это важно

RL-дообучение (выравнивание) языковых моделей всё чаще ведётся сразу на смеси разнородных задач, математика, код, наука, инструкции. Алгоритм GRPO, один из самых распространённых инструментов для такого обучения, но, как показывают авторы, его нормализация преимуществ ломается именно на разнородных задачах: сигналы обучения из разных групп запросов становятся статистически несравнимыми. GEPO устраняет этот конкретный изъян, не отказываясь от самой схемы GRPO, а значит потенциально повышает устойчивость и качество RL-обучения моделей рассуждения в реалистичных мультизадачных сценариях.

Кому это важно

Исследователям и инженерам, которые обучают reasoning-модели через RL (в духе RLHF/RLVR) с использованием GRPO и его вариантов, особенно на смешанных наборах данных из разных доменов. Также полезно тем, кто изучает динамику энтропии и её схлопывание (entropy collapse) при RL-обучении больших языковых моделей.

Как это применить

GEPO заявлен как лёгкое расширение GRPO: он использует энтропию, которая и так оценивается по уже сгруппированным сэмплам в стандартном пайплайне GRPO, без принципиально новых вычислений. Пороги корректировки advantage выводятся адаптивно из исторической статистики энтропии, а не задаются вручную под каждую задачу, это упрощает встраивание метода в существующие пайплайны RL-обучения без ручной перенастройки под каждый тип задач.

Можно ли доверять

Метод проверен на двух базовых моделях по тринадцати бенчмаркам из пяти разных областей (математика, физика, наука, код, инструкции) и сравнён напрямую с GRPO и другими недавними методами контроля энтропии, это довольно широкая проверка для одной статьи. При этом работа, препринт без указания рецензирования, а обсуждение на HuggingFace пока минимальное (16 баллов, 1 комментарий), то есть независимой верификации сообществом ещё не было.

Риски и подводные камни

Как препринт, работа не прошла независимое рецензирование. В тексте не уточняется, какие именно базовые модели использовались и насколько велики, остаётся открытым вопрос, насколько результаты переносятся на модели других семейств и масштабов. Адаптивные пороги, выводимые из исторической статистики энтропии, добавляют метода зависимость от динамики самого обучения, что теоретически может вести к нестабильности на ранних этапах, эта сторона в статье отдельно не разбирается.