Alibaba предложила ERPO, новый метод регуляризации LLM

При обучении больших языковых моделей методом подкрепления (RL) разработчики сталкиваются с компромиссом между стабильностью и исследованием (stability-exploration dilemma). Обычно эту проблему решают регуляризатором Policy-KL, который ограничивает, насколько ответы модели могут отклоняться от исходной политики. У такого подхода есть оборотная сторона: если регуляризатор включён, он сдерживает поведение модели в ответах и расходует бюджет на исследование новых стратегий; если его убрать, обучение теряет явный контроль над дрейфом политики.
Авторы, разместившие исходный код проекта на GitHub под аккаунтом Alibaba (alibaba/ERPO), предлагают решить эту дилемму иначе: перенести регуляризацию с ответов модели на входные запросы. Метод называется Environment-Regularized Policy Optimization (ERPO). Его ключевой элемент, Query-KL (QKL), член регуляризации, который ограничивает, насколько распределение обучающих запросов, порождаемое текущей политикой, отклоняется от исходного распределения, того, что было до начала RL-обучения. К этому добавлен статичный вес для каждого запроса, зависящий от эталонного распределения, который склоняет обновление модели в сторону запросов, типичных для этого эталона.
Принципиальное отличие от Policy-KL: градиент QKL идёт исключительно через вероятность запроса, а не через функцию оценки ответа, которую используют оценщики градиента политики (policy-gradient estimators). Это значит, что QKL не оказывает прямого давления на распределение ответов модели, пространство для исследования сохраняется.
По утверждению авторов, ERPO можно встроить в уже существующие RL-пайплайны на основе GRPO, PPO или REINFORCE без дополнительных прямых проходов через модель, то есть без заметного роста вычислительных затрат.
Метод протестировали на шести бенчмарках по математическому рассуждению. По заявлению авторов, ERPO заменяет собой стандартный регуляризатор Policy-KL, эффективно контролирует дрейф распределения запросов, даёт более высокую точность и заметно более стабильное поведение модели при обучении с высокой температурой декодирования и на длинных горизонтах обучения. Конкретные цифры точности и названия бенчмарков в тексте источника не приводятся. Исходный код метода выложен в открытый доступ на GitHub.
Ключевые факты
- Компромисс между стабильностью и исследованием при RL-обучении LLM обычно решают регуляризатором Policy-KL, который ограничивает поведение модели в ответах и расходует бюджет на исследование.
- Метод ERPO переносит регуляризацию на входные запросы: вводится Query-KL (QKL), ограничивающий дрейф распределения обучающих запросов от исходного (до RL) распределения.
- Градиент QKL идёт только через вероятность запроса, а не через функцию оценки ответа, пространство для исследования ответов не сужается.
- ERPO встраивается в существующие пайплайны GRPO/PPO/REINFORCE без дополнительных прямых проходов через модель.
- На шести бенчмарках по математическому рассуждению ERPO показал более высокую точность и стабильность при высокой температуре декодирования и длительном обучении; код открыт на GitHub под аккаунтом alibaba/ERPO.
Почему это важно
При RL-обучении языковых моделей давно борются с одной и той же дилеммой: регуляризатор Policy-KL, ограничивающий ответы модели, либо душит исследование новых стратегий, либо, если его ослабить, обучение теряет контроль над дрейфом политики. ERPO предлагает выход не из компромисса между двумя крайностями, а из смены самой точки приложения регуляризации, с ответов модели на входные запросы. Это методологическая новинка: она не заменяет одну реализацию Policy-KL другой, а меняет то, что вообще ограничивается регуляризацией.
Кому это важно
Инженерам и исследователям, которые обучают большие языковые модели методами подкрепления (RLHF, RLVR и аналогичные пайплайны на основе GRPO, PPO или REINFORCE) и сталкиваются с нестабильностью или потерей разнообразия ответов модели при долгом обучении или при повышенной температуре декодирования.
Как это применить
Авторы предлагают внедрять ERPO как замену Policy-KL внутри уже существующих пайплайнов на GRPO, PPO или REINFORCE, без дополнительных прямых проходов через модель, то есть без заметного увеличения вычислительных затрат. Исходный код выложен в открытый доступ на GitHub под аккаунтом Alibaba (alibaba/ERPO), что позволяет воспроизвести и протестировать метод самостоятельно.
Можно ли доверять
Материал, препринт, опубликованный на Hugging Face Papers; сведений о рецензировании или публикации в журнале либо на конференции в тексте нет. Авторы утверждают, что проверяли метод на шести бенчмарках по математическому рассуждению и получили более высокую точность и стабильность по сравнению с Policy-KL, но конкретных цифр точности или названий этих бенчмарков в тексте не приводится, оценить масштаб улучшения по самому источнику нельзя. Код открыт, что даёт возможность независимой проверки.
Риски и подводные камни
Результаты показаны только на задачах математического рассуждения, неясно, переносится ли эффект на другие типы задач (диалог, код, творческое письмо). Метод вводит собственные гиперпараметры (вес QKL, эталонное распределение запросов), подбор которых может быть нетривиальным. Подход также опирается на доступность репрезентативного эталонного распределения запросов, взятого до начала RL-обучения, в реальных пайплайнах такое распределение не всегда доступно или репрезентативно для новых доменов.