DAPD: метод дистилляции устраняет «иллюзию привилегий» у языковых моделей

При дообучении больших языковых моделей всё чаще применяют on-policy (самодистилляцию, OPSD), модель обучают на собственных ответах, дополнительно усиленных «учителем», у которого есть привилегированная информация. Авторы работы указывают: у такого подхода есть побочный эффект, «иллюзия привилегий» (privilege illusion). Модель-студент во время обучения перенимает поведение, зависящее от привилегированной информации учителя, но не может воспроизвести это поведение из своего собственного контекста при выводе (inference). При этом студент продолжает вести себя так, будто привилегированная информация ему по-прежнему доступна, из-за этого качество работы модели в итоге снижается.
По словам авторов, корень проблемы, информационная асимметрия между привилегированным учителем и студентом на этапе вывода. Чтобы устранить эту асимметрию, они предложили метод Dual-Anchored Policy Distillation (DAPD, «дистилляция политики с двойным якорением»), единый фреймворк с двумя уровнями «якорения». Первый уровень, Dual-Path Anchoring (DPA), вводит самообусловленный мост (self-conditioned bridge) и выравнивает поведение по двум согласованным по информации путям, эталонному и «раскатанному» (rollout), не давая зависящему от привилегий поведению переноситься на студента, который работает уже без доступа к привилегиям на этапе вывода. Второй уровень, Dual-Source Anchoring (DSA), применяет эти пути в обоих направлениях, от эталона к раскатке и от раскатки к эталону, снижая зависимость от привилегированных подсказок эталона, но сохраняя контроль корректности ответов.
По данным авторов, обширные эксперименты показали, что DAPD значительно ослабляет «иллюзию привилегий» и превосходит обычную OPSD-дистилляцию: на модели Qwen3-4B средний прирост качества по задачам составил +2,00 балла. Прирост сохраняется на разных масштабах модели: +2,69 балла на версии 4B и +2,78 балла на версии 32B.
Ключевые факты
- Новый метод DAPD (Dual-Anchored Policy Distillation) устраняет «иллюзию привилегий» в on-policy самодистилляции языковых моделей
- Причина проблемы, информационная асимметрия между привилегированным учителем и студентом на этапе вывода
- Метод состоит из двух механизмов: Dual-Path Anchoring (согласование эталона и раскатки) и Dual-Source Anchoring (применение в обе стороны)
- На Qwen3-4B средний прирост качества по задачам, +2,00 балла относительно обычной OPSD-дистилляции
- Прирост сохраняется на разных масштабах модели: +2,69 балла на версии 4B и +2,78 балла на версии 32B
Почему это важно
On-policy самодистилляция, распространённый приём при дообучении языковых моделей: он усиливает модель за счёт учителя с привилегированной информацией, которой сама модель при обычной работе не располагает. Авторы работы показывают, что у этого приёма есть скрытый побочный эффект, модель незаметно «привыкает» к привилегиям, которых при реальном использовании у неё уже нет, и это тихо снижает качество ответов. DAPD предлагает способ исправить именно эту причину, а не симптомы.
Кому это важно
Материал адресован исследователям и инженерам, которые занимаются пост-тренингом и дистилляцией больших языковых моделей, то есть переносом знаний от более сильной («учительской») версии модели или процесса к более слабой («студенческой»), работающей в проде.
Как это применить
DAPD описан как единый фреймворк с двумя механизмами якорения, Dual-Path Anchoring и Dual-Source Anchoring, которые можно встроить в существующий пайплайн on-policy дистилляции вместо обычной OPSD-схемы. В источнике не названы ни конкретные бенчмарки, на которых считался «средний прирост по задачам», ни требования по вычислительным ресурсам или времени обучения, это ограничивает возможность сразу оценить стоимость внедрения.
Можно ли доверять
Цифры прироста (+2,00, +2,69, +2,78 балла) заявлены самими авторами работы; источник, препринт на Hugging Face Papers, независимого подтверждения результатов в тексте нет. В источнике не указаны имена авторов, их принадлежность к организациям и дата публикации, а также нет сравнения DAPD с методами, отличными от базовой OPSD-дистилляции.
Риски и подводные камни
Заявленный эффект проверен только против одной базовой линии (OPSD) и только на семействе моделей Qwen3, неясно, насколько улучшение распространяется на другие архитектуры. Названия конкретных задач и бенчмарков, по которым усреднялся прирост, в источнике не раскрыты, как и стоимость обучения по DAPD относительно обычной дистилляции.