Исследователи представили TGOPD: дистилляция моделей с проверкой надёжности учителя

On-policy дистилляция (OPD), способ ускорить дообучение модели: замороженная модель-учитель даёт плотную, потокенную обратную связь по собственным ответам модели-ученика (rollouts). Обычная («ванильная») OPD применяет эту обратную связь одинаково для всех промптов, не проверяя, надёжен ли учитель именно на данном промпте. Авторы отмечают: поскольку используемая метрика (обратная KL-дивергенция) «ищет моду» (mode-seeking), уверенно неправильный ответ учителя может дать сильное, но вводящее в заблуждение обновление модели. Косвенные признаки вроде энтропии ответа или совпадения вероятностей учителя и ученика измеряют лишь неопределённость или согласие, но не проверяют напрямую, правильный ли получился результат.
Чтобы решить эту проблему, исследователи предложили Teacher-Gated On-Policy Distillation (TGOPD), дистилляцию с проверкой учителя на уровне промпта. Идея в том, что надёжность учителя нужно проверять для каждого промпта отдельно, прежде чем допускать его плотную обратную связь. TGOPD оценивает надёжность по небольшому набору «зондов», ответов учителя, оценённых верификатором (verifier-scored teacher probes), и направляет каждый промпт по одному из двух путей: прошёл проверку, идёт в обычную плотную OPD-дистилляцию, не прошёл, в обучение по методу GRPO с опорой на верификатор (verifier-grounded GRPO).
Метод протестировали на моделях-учениках размером 4B и 35B параметров в трёх областях: математика, код и следование инструкциям. TGOPD превзошёл обычную OPD во всех шести проверенных сочетаниях «модель × домен» (по одному домену за раз), а при совместном обучении сразу на нескольких доменах показал более высокое среднее по семи бенчмаркам на обеих моделях. Дополнительный эффект: поскольку проверка надёжности задействует иначе простаивающие вычислительные мощности учителя, TGOPD снижает потери вычислений на его стороне при асинхронной OPD, в измеренном прогоне на модели 4B в одном домене загрузка GPU учителя выросла с 9,8% до 78,9%.
Ключевые факты
- TGOPD проверяет надёжность учителя на уровне промпта перед плотной OPD-дистилляцией, а не применяет её одинаково ко всем промптам
- Промпты, не прошедшие проверку, обучаются через verifier-grounded GRPO вместо дистилляции от учителя
- На моделях 4B и 35B TGOPD обошёл обычную OPD во всех шести проверенных сочетаниях «модель × домен» (математика, код, следование инструкциям)
- При многодоменном обучении TGOPD дал более высокое среднее по семи бенчмаркам на обеих моделях
- Проверка надёжности задействует простаивающие мощности учителя и подняла загрузку его GPU с 9,8% до 78,9% в измеренном прогоне
Почему это важно
Обычная on-policy дистилляция передаёт модели-ученику плотную обратную связь от учителя одинаково для всех промптов, не проверяя, можно ли учителю доверять именно в этом случае. Поскольку используемая метрика (обратная KL-дивергенция) «ищет моду», уверенно неправильный ответ учителя способен дать сильное, но вводящее в заблуждение обновление ученика. Косвенные признаки вроде энтропии ответа или согласия вероятностей учителя и ученика измеряют лишь неопределённость, а не саму правильность результата. TGOPD закрывает именно этот пробел: он верифицирует надёжность учителя на уровне промпта до того, как его сигнал допускается к обучению.
Кому это важно
Метод адресован тем, кто занимается пост-обучением языковых моделей через дистилляцию от более сильного учителя, командам, которые строят пайплайны on-policy дистилляции или совмещают её с RL-методами вроде GRPO. Результаты показаны для моделей 4B и 35B параметров, то есть подход рассчитан и на компактные, и на средние по размеру модели.
Как это применить
TGOPD оценивает надёжность учителя по небольшому набору «зондов», ответов учителя, оценённых верификатором, и затем маршрутизирует каждый промпт: при пройденной проверке используется плотная OPD-дистилляция, при непройденной, verifier-grounded GRPO. Проверка использует вычислительные мощности учителя, которые иначе простаивали бы в асинхронной схеме обучения, поэтому TGOPD не только повышает качество, но и заметно поднимает утилизацию GPU на стороне учителя, в измеренном прогоне на модели 4B с 9,8% до 78,9%.
Можно ли доверять
Результаты опираются на собственные эксперименты авторов на моделях 4B и 35B в трёх доменах (математика, код, следование инструкциям): TGOPD превзошёл обычную OPD во всех шести одно-доменных постановках и дал более высокое среднее по семи бенчмаркам при многодоменном обучении. В доступном тексте (аннотации на Hugging Face) не названы ни авторы и их организации, ни сами семь бенчмарков, ни точная величина прироста качества, указана только конкретная цифра по загрузке GPU учителя (с 9,8% до 78,9%). Это ограничивает возможность независимо оценить масштаб улучшения.
Риски и подводные камни
В доступном тексте не раскрыты ни состав авторов и их аффилиация, ни устройство верификатора, использованного для GRPO и для оценки «зондов» учителя, ни названия семи бенчмарков многодоменного сравнения. Величина прироста качества относительно Vanilla OPD не квантифицирована числами, только сам факт превосходства во всех проверенных постановках. Метод проверен на двух размерах моделей и трёх доменах; насколько результат переносится на другие семейства моделей, масштабы и задачи, из текста не следует.