β-OPSD: новый метод самодистилляции делает обучение моделей рассуждению стабильнее

β-OPSD: новый метод самодистилляции делает обучение моделей рассуждению стабильнее

Самодистилляция по актуальной политике (on-policy self-distillation, OPSD), многообещающий способ обучать языковые модели рассуждению, но на практике метод капризный: чтобы заставить его работать стабильно, обычно требуется много инженерных усилий по подгонке. Авторы работы нашли структурную причину этой хрупкости: обычный OPSD, это ровно частный случай (β=1) более широкого семейства методов оптимизации политики, где параметр β определяет вес KL-штрафа, удерживающего обучаемую модель (студента) рядом с базовой (референсной) политикой.

Осознав это, авторы превратили β из фиксированной единицы в настраиваемый параметр регуляризации и вывели более общую формулировку, β-OPSD, которая балансирует между близостью к референсной политике и следованием более сильному «учителю» с привилегированной информацией. Для этой обобщённой цели авторы вывели оптимальную политику в явном виде: она оказывается геометрической интерполяцией между референсной политикой и учителем.

Прямая оптимизация такой цели через обучение с подкреплением была бы дорогой и давала бы высокую дисперсию оценок. Вместо этого авторы превращают готовое (замкнутое) решение задачи в цель для дистилляции: каждое значение β выбирает точку на пути от референсной политики к учителю, и эта точка реализуется простым смешиванием токенных логитов референсной модели и учителя. Так дешёвая дистилляция приближённо решает задачу, которая напрямую потребовала бы дорогой оптимизации политики. Дополнительно авторы применяют присвоение отдачи по принципу return-to-go (учёт итогового результата всей последовательности при обновлении каждого токена), чтобы токенные обновления лучше соответствовали цели на уровне всей последовательности, сохраняя при этом простоту исходного OPSD.

На бенчмарках по математическим рассуждениям β-OPSD стабильно превосходит обычный OPSD, как по устойчивости самого процесса обучения, так и по итоговому качеству рассуждений модели. Конкретные названия бенчмарков, размеры моделей, численные показатели улучшения и принадлежность авторов к организациям в тексте работы не указаны.

Ключевые факты

  • OPSD (самодистилляция по актуальной политике) улучшает обучение моделей рассуждению, но на практике нестабилен и требует много инженерной подгонки.
  • Авторы показали: обычный OPSD, частный случай (β=1) более широкого семейства методов, где β, вес KL-штрафа к референсной политике.
  • Предложен β-OPSD: оптимальная политика, геометрическая интерполяция между референсной политикой и привилегированным учителем, β задаёт точку на этом пути.
  • Вместо дорогой прямой оптимизации через обучение с подкреплением авторы решают задачу дистилляцией, смешиванием токенных логитов референсной модели и учителя.
  • На бенчмарках по математическим рассуждениям β-OPSD стабильно превосходит обычный OPSD по устойчивости обучения и итоговому качеству; конкретные цифры и названия бенчмарков не приведены.

Почему это важно

OPSD считался перспективным способом обучать модели рассуждению через самодистилляцию, но на практике был хрупким: инженеры вручную подгоняли его под каждую задачу. Эта работа объясняет причину хрупкости, скрытую фиксацию параметра β=1, и превращает частный случай в управляемое семейство методов. Это даёт более принципиальный и предсказуемый способ обучения рассуждению без потери вычислительной дешевизны, которая и делала OPSD привлекательным.

Кому это важно

Исследователям и инженерам, которые обучают рассуждающие языковые модели методами самодистилляции или похожими схемами «студент-учитель», и уже сталкивались с нестабильностью обучения OPSD на практике.

Как это применить

β-OPSD не меняет общую схему пайплайна дистилляции: студент по-прежнему учится на цели, построенной из референсной модели и более сильного учителя. Разница в том, что вместо жёстко зафиксированного веса появляется настраиваемый параметр β, который на практике реализуется смешиванием токенных логитов референсной модели и учителя в нужной пропорции, плюс учёт отдачи по принципу return-to-go при обновлении отдельных токенов.

Можно ли доверять

Материал опубликован как препринт на Hugging Face Papers (21 отметка, 2 комментария), без указания аффилиации авторов. В доступном тексте нет ни численных результатов, ни названий конкретных бенчмарков или моделей, заявленное превосходство β-OPSD над обычным OPSD подтверждается описанием экспериментов, но конкретные цифры для независимой проверки не приведены.

Риски и подводные камни

Без конкретных чисел, названий бенчмарков и размеров моделей трудно оценить реальный масштаб улучшения, заявление «стабильно превосходит» может означать как заметный, так и небольшой прирост. Результаты получены только на задачах математических рассуждений, перенос метода на другие типы задач в тексте не проверяется и не обсуждается.