TRIAGE: метод стабильного RL-обучения LLM в 4-битном NVFP4

TRIAGE: метод стабильного RL-обучения LLM в 4-битном NVFP4

Низкая точность вычислений может заметно ускорить обучение с подкреплением (RL) для больших языковых моделей, но расхождения между исполнением на стороне «обучаемой» части (learner) и «генерирующей» части (sampler) способны дестабилизировать оптимизацию политики. Статья посвящена именно этой проблеме применительно к нативному формату NVFP4.

Авторы разбирают, как рассогласование (mismatch) взаимодействует с направлением градиента политики. Они различают вклады обновлений, которые локально усиливают рассогласование, и те, что его сжимают. По одной лишь величине рассогласования такие вклады не отличить. В нативных прогонах NVFP4 авторы наблюдают ранний дисбаланс между двумя усиливающими областями: он смещён в пользу обновлений с отрицательным преимуществом (advantage) и отрицательным разрывом (gap). Хвостовые токены этих обновлений концентрируются в малой доле сегментов ответа, и лишь затем рассогласование распространяется глобально.

На основе этих наблюдений предложен TRIAGE, метод стабилизации, учитывающий направление обновлений. Он использует диагностику на уровне сегментов, чтобы избирательно перебалансировать обновления градиента политики, и применяет ограниченную (bounded) коррекцию к остаточному сильному рассогласованию. TRIAGE меняет только целевую функцию оптимизации, а нативное 4-битное исполнение прямого прохода (веса и активации, W4A4) в NVFP4 сохраняется и в sampler, и в learner.

Эксперименты на Qwen3-4B и Qwen3-30B-A3B, по утверждению авторов, показывают стабильную оптимизацию на всём рассмотренном горизонте обучения и результаты уровня полной точности на пяти математических бенчмарках. При этом нативный NVFP4 с TRIAGE даёт до 2,3 раза более высокую пропускную способность генерации (rollout), чем BF16.

Ключевые факты

  • TRIAGE, метод стабилизации RL-обучения больших языковых моделей, которое целиком идёт в нативном 4-битном формате NVFP4 (W4A4) и в sampler, и в learner.
  • Проблема: расхождения между исполнением learner и sampler в низкой точности могут дестабилизировать оптимизацию политики.
  • Наблюдение авторов: в нативных прогонах NVFP4 рано возникает дисбаланс в пользу обновлений с отрицательным преимуществом и отрицательным разрывом, а их хвостовые токены сосредоточены в малой доле сегментов ответа.
  • Метод диагностирует рассогласование на уровне сегментов, избирательно перебалансирует обновления градиента политики и ограниченно «чинит» остаточное сильное рассогласование; меняется только целевая функция.
  • На Qwen3-4B и Qwen3-30B-A3B заявлены стабильность обучения, уровень полной точности на пяти математических бенчмарках и до 2,3 раза более высокая пропускная способность генерации, чем у BF16.

Почему это важно

Генерация ответов (rollout), одна из самых затратных частей RL-обучения языковых моделей, поэтому перевод её в 4-битную точность обещает заметное ускорение. Главное препятствие, о котором пишут авторы, нестабильность из-за расхождений между learner и sampler. TRIAGE предлагает способ удержать обучение стабильным, не отказываясь от нативного NVFP4 в прямом проходе. Заявленный выигрыш, до 2,3 раза по пропускной способности генерации относительно BF16.

Кому это важно

Командам и исследователям, которые занимаются RL-дообучением языковых моделей (в том числе для математических рассуждений) и ищут способы удешевить генерацию. Также тем, кто следит за обучением в низкой точности и за проблемой рассогласования между sampler и learner.

Как это применить

Из доступного описания видно лишь суть подхода: метод меняет целевую функцию оптимизации (перебалансировка обновлений по сегментам и ограниченная коррекция остаточного рассогласования), а исполнение NVFP4 W4A4 остаётся прежним. Сведений о коде, лицензии и доступности реализации в источнике нет, так что для практического применения нужно дождаться полного текста статьи.

Можно ли доверять

Это описание научной работы, и все результаты, заявления самих авторов. Показатель 2,3 раза, максимальный («до»); из описания не следует, на какой модели и в какой конфигурации он получен. Цифровых значений качества по бенчмаркам и их перечня в описании нет, поэтому утверждение об «уровне полной точности» пока нельзя оценить количественно.

Риски и подводные камни

Проверка проведена на двух моделях семейства Qwen3 (4B и 30B-A3B) и на математических задачах; перенос на другие модели и типы задач не заявлен. Устойчивость показана на рассмотренном горизонте обучения, а его длина не указана. Сравнения с другими методами стабилизации в описании не упомянуто, поэтому преимущество TRIAGE перед ними остаётся неясным.