Метод SAF устраняет коллапс энтропии при слиянии RL-наград и дистилляции LLM

Метод SAF устраняет коллапс энтропии при слиянии RL-наград и дистилляции LLM

При дообучении языковых моделей есть два разных подхода. Первый, обучение с подкреплением на основе проверяемых наград (RLVR, reinforcement learning with verifiable rewards): модель получает одну общую награду за весь ответ, и эта награда одинаково "размазывается" по всем токенам ответа. Второй, дистилляция на политике (on-policy distillation, OPD): каждый токен ответа модели-ученика сравнивается с более сильной моделью-учителем, что даёт плотную, токен-за-токеном, оценку качества (advantage), но ограничивает ученика уровнем учителя и не даёт ему исследовать решения лучше учителя.

Авторы указывают, что эти два подхода дополняют друг друга, и их совмещение выглядит перспективным. Но при простом слиянии, когда вклад RLVR и OPD складывается с фиксированным коэффициентом, обучение ломается: наступает коллапс энтропии (модель резко теряет разнообразие ответов и "схлопывается" в узкий набор решений). Причина, по данным авторов, в двух рассогласованиях: во-первых, рассогласование по величине, токен-уровневые оценки OPD могут резко превышать по масштабу ограниченную оценку RLVR и полностью забивать её сигнал; во-вторых, рассогласование по времени, если OPD применяется на полную силу на протяжении всего обучения, она постоянно тянет ученика к учителю и не даёт ему пространства для исследования, которое нужно, чтобы превзойти учителя.

Чтобы решить обе проблемы, авторы предлагают SAF (Stable Advantage Fusion), лёгкий четырёхэтапный конвейер, который применяется только к оценке OPD и добавляет незначительные накладные расходы. Контроль по величине обеспечивается механизмом "разрежение, затем сжатие" (sparsify-then-compress), контроль по времени, механизмом "разогрев с последующим затуханием" (warm-up-then-anneal); каждый из этапов можно включать и отключать независимо от остальных.

Метод проверили, взяв за основу RLVR алгоритм GRPO, на семи бенчмарках по математическим рассуждениям и генерации кода с моделями Qwen3 трёх размеров, 1.7B, 4B и 8B параметров. SAF не допускает коллапса энтропии и стабильно превосходит слияние GRPO и OPD с фиксированным коэффициентом: агрегированный показатель качества вырос на 0,51, 2,70% во всех шести комбинациях модель-домен, а само обучение стало более стабильным.

Ключевые факты

  • RLVR даёт одну общую награду на весь ответ, OPD, плотную токен-за-токеном оценку относительно модели-учителя, но ограничивает ученика уровнем учителя
  • Простое слияние RLVR и OPD с фиксированным коэффициентом вызывает коллапс энтропии из-за рассогласования по величине оценок и по времени их применения
  • SAF, четырёхэтапный лёгкий конвейер: контроль величины через "разрежение-сжатие" и контроль времени через "разогрев-затухание", применяется только к оценке OPD
  • Проверка на GRPO с моделями Qwen3-1.7B/4B/8B на семи бенчмарках по математике и коду: SAF избегает коллапса энтропии и стабильнее обучается
  • Прирост агрегированного показателя качества, 0,51, 2,70% по сравнению с фиксированным слиянием GRPO и OPD во всех шести комбинациях модель-домен

Почему это важно

RL-обучение с проверяемыми наградами и дистилляция от более сильного учителя решают разные задачи и в теории должны усиливать друг друга, но их прямое совмещение оказалось нестабильным: система обучения буквально ломается, теряя разнообразие ответов. SAF, это инженерное решение именно этой проблемы совместимости, а не новый принцип обучения: он позволяет получить пользу от обоих подходов сразу, не жертвуя стабильностью.

Кому это важно

Работа адресована исследователям и инженерам, которые занимаются пост-тренингом языковых моделей, совмещением RL-обучения с проверяемыми наградами и дистилляции от более сильных моделей-учителей. Особенно актуально для команд, работающих с относительно небольшими открытыми моделями уровня Qwen3 (1.7, 8 млрд параметров), где качество итоговой модели напрямую зависит от эффективности пост-тренинга.

Как это применить

SAF описан как лёгкая надстройка над стандартной связкой GRPO и OPD: конвейер из четырёх этапов, каждый из которых включается или отключается независимо, а накладные расходы на вычисления незначительны. В тексте источника не сказано, опубликован ли код метода в открытом доступе, судить об этом нельзя.

Можно ли доверять

Это препринт с HuggingFace, не прошедший рецензирование, но результаты проверены на семи бенчмарках по математическим рассуждениям и генерации кода на трёх размерах модели Qwen3, что даёт шесть комбинаций модель-домен. Заявленный прирост, 0,51, 2,70% агрегированного показателя; абсолютные значения точности в источнике не приводятся. Сравнения SAF с другими методами дистилляции, кроме фиксированного слияния GRPO+OPD, в тексте нет.

Риски и подводные камни

Прирост качества скромный (доли процента, единицы процентов), а не прорывной. Метод проверен только на модели Qwen3 и только на размерах до 8 млрд параметров, неясно, как SAF поведёт себя на более крупных моделях или на других семействах. Источник не указывает, какой из четырёх этапов конвейера вносит основной вклад в улучшение, и не сравнивает SAF с альтернативными способами борьбы с коллапсом энтропии.