Calibrated Clipping решает проблему нестабильности FP8-обучения LLM с подкреплением

Calibrated Clipping решает проблему нестабильности FP8-обучения LLM с подкреплением

Обучение с подкреплением (reinforcement learning, RL), ключевая техника для развития навыков рассуждения и агентности у больших языковых моделей. Квантование в формате FP8 способно ускорить такое обучение, но сохранить стабильность на всём пайплайне FP8-RL оказалось сложно. Прежние работы пытались решать это через техники коррекции несоответствия между обучением и инференсом, такие как TIS, но авторы новой работы показывают: даже при использовании таких техник полный FP8-пайплайн RL всё равно страдает от серьёзной нестабильности, она проявляется как аномальные всплески энтропии в середине обучения и как «сломанные», бессвязные выходы модели.

Авторы прослеживают эту нестабильность до ранее незамеченной причины: накопленный шум квантования FP8 искажает importance ratio (отношение важности, используемое в алгоритмах RL) и непропорционально сильно выталкивает токены с отрицательным advantage (отрицательной оценкой полезности действия) за пределы доверительной области (trust region). В результате их градиенты ошибочно обнуляются. Из-за этого эффекта патологические, некачественные выходы модели не получают должного штрафа и накапливаются по ходу обучения.

Чтобы решить проблему, авторы предлагают Calibrated Clipping, динамический метод, который выравнивает границы отсечения (clipping) в FP8 с распределениями в высокоточном формате BF16: нижняя граница подгоняется по квантилю отсечения BF16, а верхняя пересчитывается соответствующим образом. Метод проверили в обширных экспериментах на алгоритмах GRPO и DAPO, на моделях масштабом от 8 до 32 миллиардов параметров и при разных вариантах гранулярности масштабирования FP8. По итогам испытаний подход устраняет всплески энтропии и восстанавливает качество работы модели до уровня, сопоставимого с базовым вариантом на BF16.

Ключевые факты

  • FP8-квантование ускоряет RL-обучение LLM, но полный FP8-пайплайн остаётся нестабильным даже при применении прежних техник коррекции вроде TIS
  • Нестабильность проявляется как всплески энтропии в середине обучения и как бессвязные, «сломанные» выходы модели
  • Причина, накопленный шум FP8-квантования искажает importance ratio и ошибочно обнуляет градиенты у токенов с отрицательным advantage, из-за чего плохие выходы не штрафуются и накапливаются
  • Предложенный метод Calibrated Clipping динамически выравнивает границы отсечения FP8 с распределениями BF16, подгоняя нижнюю границу по квантилю и пересчитывая верхнюю
  • Метод протестирован на алгоритмах GRPO и DAPO, моделях от 8 до 32 миллиардов параметров и разной гранулярности масштабирования FP8, устраняя всплески энтропии и восстанавливая качество до уровня BF16

Почему это важно

FP8-квантование даёт заметное ускорение при обучении с подкреплением, но до сих пор такие тренировки могли неожиданно срываться, модель начинала выдавать бессвязный текст, а показатель энтропии резко подскакивал в середине обучения. Работа впервые объясняет механизм этого сбоя: накопленный шум квантования искажает служебную метрику importance ratio и заставляет алгоритм ошибочно обнулять градиенты у части токенов, из-за чего плохие ответы модели перестают штрафоваться и множатся.

Кому это важно

Прежде всего инженерам и исследователям, которые обучают большие языковые модели методом reinforcement learning и хотят использовать FP8 для экономии вычислений и памяти, например, командам, разрабатывающим модели с усиленными навыками рассуждения и агентности.

Как это применить

Предложенный метод Calibrated Clipping можно встроить в существующий пайплайн FP8-обучения: он динамически подстраивает границы отсечения значений в FP8 под распределения, наблюдаемые в высокоточном BF16-формате, вместо статичных фиксированных границ. По описанию авторов, метод совместим с разными алгоритмами RL (проверен на GRPO и DAPO) и разными масштабами моделей.

Можно ли доверять

Материал опубликован как препринт исследования; в тексте не указаны авторы, организация и дата публикации, а также отсутствуют конкретные числовые метрики (точность, ускорение, проценты) для сравнения FP8 и BF16, заявленное «сопоставимое с BF16» качество не подкреплено цифрами в доступном тексте. Заявления о экспериментах на GRPO/DAPO и моделях 8B, 32B приведены со слов авторов работы.

Риски и подводные камни

Без указания авторов и институтов сложно оценить независимость и репутацию исследования. В тексте не раскрыто, какие датасеты и бенчмарки использовались для проверки, а также детали устройства прежних техник коррекции вроде TIS, с которыми сравнивается новый метод, это ограничивает возможность самостоятельной проверки заявленных результатов.