Cal-OPD очищает дистилляцию моделей рассуждений от шума учителя

Cal-OPD очищает дистилляцию моделей рассуждений от шума учителя

Дистилляция с текущей политикой ученика (on-policy distillation, OPD), способ обучать модели рассуждений: ученик учится на расхождении между вероятностями более сильного учителя и собственными вероятностями на ответах, которые он сгенерировал сам. Авторы работы показывают, что это расхождение отражает не только разрыв в возможностях между учителем и учеником, часть его составляют собственные отклонения самого учителя, и стандартная OPD учит их наравне с полезным сигналом, без разбора.

Проблема усиливается в «привилегированной» версии OPD, где ученику во время обучения дают дополнительную привилегированную информацию: она вызывает у учителя более сильные сдвиги вероятностей, из-за чего ученик начинает ещё сильнее перенимать собственные отклонения учителя вместо разницы в способностях между ним и учеником.

Чтобы это исправить, авторы предлагают калиброванную дистилляцию с текущей политикой (Calibrated On-Policy Distillation, Cal-OPD). Метод оценивает область собственных отклонений учителя с помощью положительных и отрицательных привилегированных вмешательств, а затем калибрует исходное расхождение учитель-ученик, оставляя для обучения только ту часть, что выходит за пределы этой области, то есть отбрасывает то, что похоже на шум самого учителя, а не на разницу в способностях.

В экспериментах на бенчмарках по математическим рассуждениям Cal-OPD использует в качестве обучающего сигнала лишь около 52, 65% исходного расхождения учитель-ученик, но при этом стабильно превосходит стандартную OPD и её варианты на моделях разного масштаба.

Ключевые факты

  • Исследователи представили Cal-OPD, калиброванную версию дистилляции с текущей политикой ученика (on-policy distillation) для моделей рассуждений
  • Обычная OPD путает разрыв в возможностях учителя и ученика с собственными отклонениями (шумом) самого учителя и учит их без разбора
  • В «привилегированной» OPD проблема усиливается: привилегированная информация вызывает у учителя более сильные сдвиги вероятностей
  • Cal-OPD оценивает область шума учителя через положительные и отрицательные привилегированные вмешательства и убирает её из сигнала обучения
  • На бенчмарках по математике Cal-OPD обходит стандартную OPD и её варианты на моделях разного масштаба, используя лишь 52, 65% исходного сигнала

Почему это важно

Дистилляция с текущей политикой ученика, основной способ передавать модели рассуждений умение сильного учителя, но если сигнал для обучения загрязнён собственным шумом учителя, часть обучающего бюджета уходит впустую или даже уводит ученика в сторону от бесполезного паттерна. Работа показывает, что можно оставить в сигнале лишь 52, 65% исходного расхождения учитель-ученик и при этом получить более сильную, а не более слабую модель, то есть часть проблемы стандартной OPD была не в нехватке сигнала, а в его качестве.

Кому это важно

Команды, которые обучают модели рассуждений через дистилляцию от более сильного учителя, особенно в схемах с привилегированной информацией (privileged OPD), где, по данным авторов, доля шума учителя в сигнале ещё выше. Метод и его логика полезны исследователям, работающим над эффективностью и качеством обучающих сигналов при переносе знаний между моделями.

Как это применить

Cal-OPD встраивается в существующий пайплайн дистилляции с текущей политикой ученика: перед тем как использовать расхождение между учителем и учеником как обучающий сигнал, нужно провести положительные и отрицательные привилегированные вмешательства, чтобы оценить область собственных отклонений учителя, и вычесть её из сигнала. Источник не приводит код или инструкцию по реализации, только принцип метода.

Можно ли доверять

Источник, работа, опубликованная на HuggingFace Papers; в доступном тексте нет имён авторов, институтов, названий конкретных бенчмарков и моделей, а также даты публикации. Заявленный результат (52, 65% сигнала при устойчивом превосходстве над стандартной OPD) описан только на уровне математических бенчмарков рассуждений, независимого воспроизведения или рецензирования в тексте не упомянуто, а обсуждение материала на момент публикации минимально.

Риски и подводные камни

В тексте не раскрыт механизм построения самих привилегированных вмешательств, только то, что они «положительные» и «отрицательные». Результат проверен только на математических бенчмарках рассуждений, поэтому неясно, переносится ли выигрыш на другие типы задач. Метод добавляет отдельный шаг калибровки поверх обычной OPD, а значит и дополнительную вычислительную и инженерную нагрузку, которую источник не оценивает.