OPD²: новый метод дистилляции ускоряет перенос reasoning в ИИ-моделях

OPD²: новый метод дистилляции ускоряет перенос reasoning в ИИ-моделях

On-policy дистилляция, способ дообучения языковых моделей (post-training) в рамках обучения с подкреплением, альтернативный обучению через модели-награды (reward models): вместо оценки готового ответа модель-учитель даёт токен-level (пословную) обратную связь. Метод уже применяется в разных сценариях, но его базовый дизайн, какой именно сигнал брать от учителя, исследован слабо: обычно модель-ученика просто заставляют копировать распределение вероятностей учителя целиком.

Автор работы Бёнхо Хо (Byeongho Heo) с соавторами предлагают другой сигнал, «дельта-сигнал» (delta signal). Он определяется как разница между весами/поведением модели-учителя ПОСЛЕ обучения reasoning-способностям и той же моделью ДО инструктивной настройки на рассуждения (то есть базовой моделью). Идея: раз дельта, это именно то, что добавило учителю умение рассуждать, то она и есть наиболее прямой сигнал для передачи этого умения ученику, а не всё распределение ответов учителя целиком (в котором помимо reasoning есть много не относящегося к делу).

На основе этого сигнала авторы формулируют метод On-Policy Delta Distillation (OPD²). В экспериментах на бенчмарках по математике, естественным наукам и code-reasoning (рассуждениям при написании кода) OPD² стабильно превосходит обычную on-policy дистилляцию и позволяет получить сильные reasoning-модели при заметно более коротком этапе post-training. Код обещают выложить в открытый доступ на GitHub (naver-ai/opd2).

Ключевые факты

  • On-policy дистилляция даёт модели-ученику токен-level обратную связь от учителя вместо оценки через reward model, но её базовый дизайн изучен слабо
  • Авторы вводят «дельта-сигнал», разницу между учителем после reasoning-тюнинга и тем же учителем до него (базовой моделью)
  • Дельта-сигнал точнее передаёт именно то, что добавило учителю умение рассуждать, в отличие от копирования всего распределения ответов
  • Метод назван On-Policy Delta Distillation (OPD²); проверен на бенчмарках по математике, науке и рассуждениям при написании кода
  • OPD² стабильно превосходит классическую on-policy дистилляцию и требует более короткого этапа дообучения; код обещают выложить на GitHub (naver-ai/opd2)

Почему это важно

On-policy дистилляция, один из основных способов передать reasoning-способности от большой модели-учителя к меньшей модели-ученику при post-training, но до сих пор было неясно, какой именно сигнал от учителя брать для обучения. Работа показывает, что важна не вся выдача учителя целиком, а конкретно та её часть, которая появилась благодаря обучению рассуждениям (дельта между тюнингованной и базовой версией). Это меняет саму формулировку задачи дистилляции и, по данным авторов, даёт заметный прирост качества при более коротком обучении.

Кому это важно

Прежде всего, исследовательским командам и лабораториям, которые занимаются post-training и дистилляцией reasoning-моделей: разработчикам компактных ИИ-моделей, которым нужно перенести умение рассуждать от крупной модели в меньшую и более дешёвую в эксплуатации, а также исследователям обучения с подкреплением для LLM в целом.

Как это применить

Практический рецепт: вместо того чтобы обучать ученика копировать полное распределение вероятностей учителя, нужно вычислить разницу между учителем после reasoning-тюнинга и его же базовой (до-инструктивной) версией и использовать эту разницу как награду в on-policy обучении. Авторы обещают выложить код на GitHub (naver-ai/opd2), что должно позволить воспроизвести метод на собственных моделях после публикации.

Можно ли доверять

Материал, препринт на arXiv, размещённый на площадке Hugging Face Papers (28 баллов, 3 комментария на момент сбора), с эмпирической проверкой на нескольких типах бенчмарков (математика, наука, код). Авторы обещают открыть код, что позволит независимо проверить заявленные результаты после публикации.

Риски и подводные камни

Это препринт без указания прохождения рецензирования; код на момент публикации ещё не выложен («will be available»), поэтому независимая проверка результатов пока невозможна. Метод требует доступа к базовой (до reasoning-тюнинга) версии модели-учителя, для закрытых моделей, где такая версия недоступна, применить дельта-сигнал в этом виде не получится.