RIPO: новый алгоритм RL обошёл GRPO в тесте AIME24 (до 60%)

Обучение с подкреплением (RL), основной способ развивать умение больших языковых моделей (LLM) рассуждать, но самый распространённый алгоритм этого класса, PPO-Clip, годами страдает от известной проблемы: в какой-то момент модель перестаёт пробовать редкие варианты ответа и «схлопывается» на уже выученном узком поведении, это называют схлопыванием разведки (exploration collapse). Прежние попытки исправить проблему были эвристическими заплатками и не объясняли её настоящую причину. Автор работы, Чжичэн Цай с соавторами, утверждает, что нашёл эту причину: механизм отсечения в PPO-Clip неявно измеряет, насколько изменилась политика модели, обычной евклидовой метрикой, хотя реальное пространство возможных политик устроено иначе, оно риманово. Из-за этого несоответствия обновления получаются слишком осторожными там, где вероятность действия низкая, и слишком резкими там, где она высокая, и это постепенно убивает разведку.
Чтобы исправить геометрическую ошибку, авторы предложили RIPO (Riemannian Isometric Policy Optimization), метод, который обновляет политику изометрично, то есть с сохранением расстояний, прямо на римановом многообразии, и за счёт этого держит баланс между разведкой и использованием накопленного опыта. По их данным, RIPO также даёт более выгодный компромисс смещения и дисперсии, из-за чего обучение стабильнее. На семи тестах соревновательного уровня RIPO обошёл существующие RL-алгоритмы для LLM; на тесте AIME24 прирост относительно алгоритма GRPO доходит до 60%. Работа опубликована на Hugging Face Papers и пока набрала всего 10 баллов и 2 комментария, независимой проверки результатов на сегодня нет.
Ключевые факты
- PPO-Clip неявно измеряет изменение политики евклидовой метрикой, хотя пространство политик устроено по-римановому, из-за этого несоответствия обновления получаются слишком осторожными для редких действий и слишком резкими для частых, что и «схлопывает» разведку.
- Авторы предлагают RIPO (Riemannian Isometric Policy Optimization), метод, который делает обновления политики изометричными прямо на римановом многообразии, сохраняя баланс между разведкой и использованием накопленного опыта.
- По заявлению авторов, RIPO даёт более выгодный компромисс смещения и дисперсии, из-за чего обучение становится стабильнее.
- На семи тестах соревновательного уровня RIPO обошёл существующие RL-алгоритмы для LLM; на AIME24 прирост относительно GRPO доходит до 60%.
- Работа опубликована на Hugging Face Papers и пока набрала только 10 баллов и 2 комментария; первый автор, Чжичэн Цай, независимой проверки результатов на сегодня нет.
Почему это важно
RL, главный инструмент, которым сейчас развивают способность больших языковых моделей рассуждать, а стандартный для этой задачи алгоритм PPO-Clip годами страдает от схлопывания разведки: модель постепенно перестаёт пробовать новые варианты ответа. Прежние попытки исправить это были эвристическими заплатками. Автор статьи утверждает, что нашёл настоящую причину, геометрическое рассогласование между тем, как PPO-Clip измеряет изменение политики (обычной евклидовой метрикой), и тем, как на самом деле устроено пространство политик (риманова геометрия). Если вывод подтвердится, это меняет подход к проектированию RL-алгоритмов для LLM, а заявленный прирост до 60% на AIME24 относительно GRPO, заметный практический результат.
Кому это важно
Командам и исследователям, которые обучают большие языковые модели через RL, чтобы улучшить их способность рассуждать; инженерам, работающим с алгоритмами вроде PPO и GRPO; теоретикам RL, которым интересна геометрия оптимизации политик.
Как это применить
RIPO предлагается как замена механизма отсечения в алгоритмах вроде PPO-Clip: вместо стандартного евклидова отсечения, изометричное обновление политики прямо на римановом многообразии. Команда, которая обучает свою языковую модель через RL, в теории может встроить такой подход в свой пайплайн. Но в источнике нет ни ссылки на код или готовую реализацию, ни сведений о лицензии, внедрение потребует самостоятельно реализовать метод по описанию из статьи и проверить его на своих задачах.
Можно ли доверять
Заявка выглядит проработанной, есть теоретическое обоснование и эксперименты на семи тестах, но пока это одна научная публикация без независимого подтверждения. На Hugging Face Papers у неё всего 10 баллов и 2 комментария, сообщество почти не успело её обсудить. Первый автор, Чжичэн Цай, не входит в число широко известных исследователей RL, а список соавторов и организация в тексте не указаны, до появления повторных экспериментов от других команд к результатам стоит относиться как к предварительным.
Риски и подводные камни
Цифра «до 60%», по формулировке источника это лучший результат из семи тестов, а не средний прирост, и сам источник называет только один тест (AIME24): какие ещё шесть тестов использовались и на каких условиях сравнивался GRPO, в тексте не раскрыто. Ссылки на код или открытую реализацию RIPO в источнике нет, поэтому пока результаты нельзя независимо перепроверить или повторить на других моделях и задачах.
«Эта работа вскрывает фундаментальный изъян PPO-Clip: он неявно измеряет расхождение политик евклидовой метрикой, что теоретически несогласовано с внутренней геометрией риманова многообразия политик.»
— Чжичэн Цай с соавторами, «Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization»