Исследователи разработали BPCO, устойчивую замену GRPO для обучения ИИ

Групповые методы обучения с подкреплением для языковых моделей, такие как GRPO (Group Relative Policy Optimization), не обучают отдельный критик, сеть, оценивающую качество ответа. Вместо этого для каждого промпта генерируется несколько ответов, и они сравниваются между собой. Надёжный критик мог бы вместо этого оценивать преимущество (advantage) каждого токена всего по одному сгенерированному ответу, но стандартные схемы обучения критика часто нестабильны.
Исследователи изучили причины этой нестабильности и предложили Best Practice Critic Optimization (BPCO), рецепт обучения, объединяющий пять приёмов: DPPO, ограничение предсказаний ценности диапазоном возможных наград, цели ценности по методу Монте-Карло, ненормированные преимущества политики и адаптивную по длине версию обобщённой оценки преимущества (GAE). Поскольку критик используется только на этапе обучения и не участвует в работе самой модели (политики), его можно снабжать информацией, которая определяет награду, но скрыта от политики, например, эталонным ответом или рубрикой оценивания.
Контролируемые эксперименты позволили изолированно оценить вклад каждого из пяти приёмов. На задачах математического рассуждения и моделях размером от 1,5 млрд параметров до модели-смеси экспертов 30B-A3B BPCO стабильно улучшает результат сильного критик-базового варианта и по качеству не уступает групповому методу вроде GRPO, при этом требуя всего одного сэмплированного ответа на промпт вместо нескольких. Тот же рецепт улучшает обучение и при наградах на основе рубрик оценивания. Код выложен на GitHub (QPHutu/golden_critic).
Ключевые факты
- BPCO обучает критика по ОДНОМУ сгенерированному ответу на промпт, альтернатива групповому семплингу GRPO, которому нужно несколько ответов
- Рецепт сочетает пять приёмов: DPPO, ограничение предсказаний ценности диапазоном наград, цели ценности по Монте-Карло, ненормированные преимущества политики и адаптивную по длине GAE
- Критик используется только при обучении, поэтому может учитывать скрытую от модели информацию, эталонный ответ или рубрику оценивания
- На задачах математического рассуждения (модели от 1,5 млрд параметров до MoE 30B-A3B) BPCO не уступает групповому базовому методу при меньшем числе сэмплов и стабильно улучшает критик-базовый вариант
- Код опубликован на GitHub (QPHutu/golden_critic); конкретные числовые результаты, точность, проценты улучшения, в изученном материале не приведены
Почему это важно
RL-обучение рассуждающих языковых моделей обычно полагается на групповые методы вроде GRPO, которые генерируют несколько ответов на каждый промпт ради устойчивой оценки, это дорого по вычислениям. Надёжный критик, оценивающий преимущество по одному ответу, снижает эту стоимость, но раньше критик-схемы были нестабильны. BPCO закрывает этот пробел системным подбором из пяти уже существующих техник.
Кому это важно
Командам, обучающим рассуждающие модели через RL, особенно там, где генерация множества ответов на промпт дорога по вычислениям; разработчикам систем с наградами на основе рубрик оценивания, где критик может учитывать критерии, скрытые от самой модели.
Как это применить
Рецепт BPCO объединяет DPPO, ограничение предсказаний ценности диапазоном наград, цели ценности по Монте-Карло, ненормированные преимущества политики и адаптивную по длине GAE, вклад каждого из пяти компонентов подтверждён отдельными абляциями. Код доступен на GitHub (QPHutu/golden_critic), что позволяет воспроизвести рецепт и заменить групповой семплинг в существующих RL-пайплайнах обучением критика по одному ответу на промпт.
Можно ли доверять
Работа подкреплена контролируемыми экспериментами, изолирующими вклад каждого из пяти приёмов, и проверена на диапазоне размеров моделей, от 1,5 млрд параметров до модели-смеси экспертов 30B-A3B. В изученном материале при этом не указаны конкретные бенчмарки, датасеты и числовые результаты, точность или проценты улучшения, а также институциональная принадлежность авторов и дата публикации.
Риски и подводные камни
Рецепт, это системная инженерная комбинация пяти уже известных техник, а не принципиально новый метод; итоговая практическая ценность улучшения не подтверждена конкретными цифрами в изученном материале. Результаты показаны только на задачах математического рассуждения, обобщение на другие типы RL-обучения языковых моделей в тексте не проверялось.