В PPO для обучения LLM нашли системный сбой критика, Value Flattening

В обучении языковых моделей с подкреплением алгоритм PPO (Proximal Policy Optimization) обычно использует критика, отдельную модель, которая оценивает ценность промежуточных состояний и за счёт этого снижает дисперсию (разброс) обновлений политики. Авторы работы обнаружили в этой схеме системный сбой, который назвали Value Flattening (буквально «уплощение ценности»): истинные ценности состояний, оценённые через несколько продолжений по методу Монте-Карло, резко меняются между соседними промежуточными состояниями, тогда как предсказания самого критика остаются заметно более плоскими, то есть критик не успевает отражать эти реальные скачки.
Тот же эффект авторы воспроизвели в контролируемой тестовой среде FrozenLake и показали, что он усиливается по мере роста пространства состояний. Теоретический и эмпирический анализ связывает Value Flattening с двумя причинами: неявным штрафом за дисперсию, встроенным в функцию потерь критика, и избыточными обновлениями от временно́ скоррелированных состояний со схожими градиентами, то есть критик много раз переучивается на почти одинаковых сигналах вместо того, чтобы улавливать реальные различия между состояниями.
Чтобы смягчить проблему, авторы предлагают SP³O (SParse Proximal Policy Optimization), модификацию PPO, в которой функция потерь критика применяется не ко всем состояниям ответа, а только к нескольким хорошо разделённым между собой состояниям. В экспериментах на модели Qwen3-Base разметки всего трёх состояний на каждый ответ оказалось достаточно, чтобы смягчить Value Flattening и стабильно улучшить итоговую политику, эффект сохранялся при разных размерах моделей и на разных наборах для оценки. Конкретных числовых показателей прироста качества в тексте не приведено. Авторы заключают, что Value Flattening, важный, но ранее не описанный сбой обучения критика в стандартном PPO, а предложенная простая стратегия разреженной разметки состояний способна его смягчить.
Ключевые факты
- PPO использует критика для оценки ценности состояний и снижения дисперсии обновлений политики, авторы нашли в этой схеме системный сбой, названный Value Flattening.
- Value Flattening: истинные ценности состояний (по нескольким продолжениям методом Монте-Карло) резко меняются между соседними состояниями, а предсказания критика остаются почти плоскими.
- Эффект воспроизведён в контролируемой среде FrozenLake и усиливается с ростом пространства состояний.
- Причины, неявный штраф за дисперсию в функции потерь критика и избыточные обновления от временно́ скоррелированных состояний со схожими градиентами.
- Предложенный метод SP³O применяет функцию потерь критика только к нескольким разделённым состояниям в ответе; на Qwen3-Base разметки всего трёх состояний на ответ хватило, чтобы смягчить Value Flattening и стабильно улучшить политику для разных размеров моделей и наборов оценки.
Почему это важно
PPO с обучаемым критиком, стандартная схема обучения с подкреплением, которую используют при пост-тренинге языковых моделей (в том числе в RLHF-подобных пайплайнах). Если критик не успевает отслеживать реальные скачки ценности состояний, сигнал для обновления политики становится менее точным, и это происходит незаметно, без явных симптомов сбоя. Работа впервые называет и описывает этот конкретный механизм деградации, а не просто фиксирует, что обучение идёт хуже ожидаемого.
Кому это важно
Инженерам и исследователям, которые настраивают RL-обучение языковых моделей на базе PPO с критиком, в первую очередь тем, кто работает с пост-тренингом больших моделей вроде семейства Qwen3, на котором проверялся метод. Также полезно тем, кто разрабатывает или тюнит собственные варианты actor-critic-алгоритмов для LLM.
Как это применить
Практическое предложение, SP³O: вместо того чтобы применять функцию потерь критика ко всем промежуточным состояниям ответа, она применяется лишь к нескольким хорошо разделённым состояниям (в экспериментах, к трём на ответ). Это точечное изменение в вычислении лосса критика, а не переработка всего пайплайна обучения, что делает метод относительно простым для включения в существующие реализации PPO.
Можно ли доверять
Источник, препринт с Hugging Face Papers, текст представляет собой аннотацию работы. Авторы подкрепляют находку теоретическим анализом и эмпирическими экспериментами в двух разных условиях, на языковой модели Qwen3-Base и в контролируемой среде FrozenLake, что говорит в пользу воспроизводимости эффекта. При этом в самой аннотации не указаны ни имена авторов и организации, ни место публикации, ни конкретные числовые показатели улучшения, только формулировка «стабильно улучшает политику». Проверить масштаб эффекта по одному тексту аннотации нельзя.
Риски и подводные камни
Улучшение описано качественно («стабильно улучшает политику»), без цифр, оценить, насколько велик выигрыш по сравнению со стандартным PPO, по тексту невозможно. Эксперименты ограничены моделями семейства Qwen3-Base; перенос результата на другие архитектуры и масштабы явно не проверялся. Статус публикации (рецензирование, конференция) в тексте не указан, что типично для препринта.