SA-MRPO: новый метод RL для LLM поднял точность рассуждений до 9,2%

При дообучении языковых моделей-рассуждателей обучением с подкреплением (RL) стандартом стал подход с групповыми относительными преимуществами (advantages): группе ответов на один и тот же промпт присваивают преимущества относительно друг друга. Когда модель нужно одновременно оптимизировать по нескольким наградам, например, правильность решения и качество кода, их обычно схлопывают в один сигнал фиксированной взвешенной суммой ещё до того, как преимущества стандартизируют внутри группы.
Авторы показывают, что у такого подхода два системных изъяна. Во-первых, роллауты (сгенерированные моделью попытки) с совершенно разными профилями наград могут получить одинаковое итоговое преимущество, модель не различает, за что именно её поощрили. Во-вторых, все награды обучаются с одними и теми же фиксированными весами независимо от того, насколько каждая из них уже «насыщена» (близка к своему пределу). В результате обучение продолжает тратить градиентный бюджет на уже решённые задачи вместо тех, где ещё есть запас для роста.
Решение авторов, SA-MRPO (Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization, «взвешивание преимуществ с учётом насыщения для мультинаградной оптимизации политики»). Метод стандартизирует каждую награду по отдельности и адаптивно снижает её вклад по мере того, как батч-оценка показывает рост насыщения этой задачи. Это динамически перенаправляет усилия оптимизации на недообученные задачи, при этом сохраняя качество на уже хорошо решённых. Авторы отдельно отмечают: взвешивание по насыщению способно не просто изменить масштаб обновления весов модели, а развернуть его знак на противоположный.
На задачах математических рассуждений с комбинациями из двух и трёх наград SA-MRPO улучшил более сложную из них, правильность ответа, по сравнению с базовым методом GDPO в 12 из 15 сравнений на бенчмарках, с приростом до 5% на AIME24. На адаптивных задачах рассуждения метод повысил точность на всех пяти бенчмарках, в среднем на 3,8%, а на AMC23, до 9,2%. На бенчмарках по кодингу прирост доли пройденных тестов (pass rate) составил до 2,3%. Во всех сценариях более простые награды остались примерно на уже достигнутом уровне, метод не жертвует ими ради сложных задач.
Ключевые факты
- SA-MRPO стандартизирует каждую награду независимо и снижает её вес по мере насыщения, вместо фиксированной взвешенной суммы всех наград.
- На математических рассуждениях метод обошёл базовый GDPO по правильности ответа в 12 из 15 сравнений, с приростом до 5% на AIME24.
- На адаптивных задачах рассуждения точность выросла на всех пяти бенчмарках, в среднем на 3,8%, максимум на 9,2% на AMC23.
- На бенчмарках по кодингу доля пройденных тестов выросла до 2,3%.
- Взвешивание по насыщению может развернуть знак обновления весов модели, а не только изменить его масштаб.
Почему это важно
Обучение с подкреплением по нескольким наградам одновременно, стандартная часть пост-тренинга современных рассуждающих моделей: одна награда следит за правильностью ответа, другая, за форматом или качеством кода. При фиксированных весах наград модель продолжает «дожимать» уже решённые задачи вместо того, чтобы работать над сложными. SA-MRPO устраняет именно этот изъян, позволяя эффективнее использовать тот же объём вычислений при обучении.
Кому это важно
Прежде всего командам, которые дообучают LLM-рассуждатели через RL с несколькими критериями качества одновременно, например, точность решения плюс соблюдение формата или качество кода. Метод полезен и исследователям, работающим над алгоритмами оптимизации политики (RLHF/RLVR), которые ищут способ точнее распределять градиентный бюджет между целями.
Как это применить
SA-MRPO встраивается в существующий пайплайн обучения с подкреплением на уровне вычисления преимуществ: вместо одной взвешенной суммы наград каждая награда стандартизируется отдельно, а её вклад в итоговое преимущество адаптивно уменьшается по батч-оценке насыщения. В доступном тексте не приведены детали архитектуры моделей, объём вычислений или код, практическое внедрение потребует реализации метода по описанию из статьи.
Можно ли доверять
Результаты получены на нескольких открытых бенчмарках математических и адаптивных рассуждений, а также кодинга, с прямым сравнением против базового метода GDPO, методологически это корректная постановка эксперимента. В то же время в доступном тексте не указаны авторы, организации, дата публикации и площадка, а также размер и архитектура использованных моделей, независимо перепроверить масштаб экспериментов по одному тексту не получится.
Риски и подводные камни
Заявленный прирост, это максимумы («до 5%», «до 9,2%») на конкретных бенчмарках, а не средний эффект по всем задачам: на 3 из 15 сравнений по правильности ответа метод не превзошёл базовый GDPO. Насколько эффект переносится на другие типы наград, домены и более крупные модели, по тексту не проверяется.