Новый метод VCSD поднял точность моделей Qwen3-VL и Qwen3.5 без внешнего учителя

Дистилляция знаний, способ обучать модель по подсказкам более сильного «учителя». В варианте on-policy distillation (OPD) учитель, отдельная, обычно более мощная модель. On-policy self-distillation (OPSD) обходится без неё: роль учителя играет сама обучаемая модель, но тогда учителю всё равно нужно какое-то преимущество перед учеником, иначе его подсказки не несут новой информации. Существующие методы создают это преимущество, давая учителю доступ либо к привилегированным (заранее известным) правильным ответам, либо к дополнительной визуальной информации, которой нет у ученика. Ицзюнь Лян с соавторами задались вопросом: можно ли убрать оба этих костыля и получить более простую версию OPSD, которая опирается только на то, как по-разному подан на вход один и тот же кадр.
Предложенный ими метод, Visual Contrastive Self-Distillation (VCSD), превращает само удаление содержимого изображения в сигнал для самодистилляции. Для каждого префикса ответа, который генерирует модель-ученик, модель-учитель, экспоненциально сглаженная (EMA) копия той же модели, дважды предсказывает распределение вероятностей следующего токена при одном и том же запросе и префиксе: один раз с исходным изображением, второй раз, с изображением, у которого «стёрто» содержимое. Разница логарифмов вероятностей между этими двумя предсказаниями показывает, у каких токенов вероятность выросла именно из-за конкретного содержимого картинки, то есть какие фрагменты ответа модель формирует, реально опираясь на изображение, а не по общим языковым догадкам. Этим контрастом «обостряют» исходное распределение учителя в пределах его правдоподобного диапазона значений, а уже уточнённое распределение дистиллируют в ученика.
Метод проверили на датасете ViRL39K на моделях семейств Qwen3-VL и Qwen3.5: VCSD стабильно обходит по качеству эквивалентно настроенный (matched) OPSD. Для Qwen3-VL совокупный показатель по семи бенчмаркам вырос с 62,27% до 67,04% на версии 2B, с 71,30% до 73,16% на версии 4B и с 72,51% до 76,26% на версии 8B. При этом VCSD не требует ни внешнего учителя, ни привилегированных ответов, ни отдельного сигнала визуальных подсказок, ни цепочек рассуждений (reasoning traces), и не увеличивает затраты на инференс: вся дополнительная нагрузка приходится только на этап обучения.
Ключевые факты
- Новый метод самодистилляции VCSD обходится без внешнего учителя, привилегированных ответов и отдельного сигнала визуальных подсказок, сигналом служит только сравнение ответа модели с изображением и без него.
- Модель-учитель (EMA-копия модели-ученика) дважды предсказывает следующий токен по одному и тому же префиксу ответа, с исходной картинкой и с «зачищенной» версией той же картинки; разница вероятностей показывает, какие токены модель выбирает именно благодаря изображению.
- На Qwen3-VL совокупный показатель по семи бенчмаркам вырос с 62,27% до 67,04% на версии 2B, с 71,30% до 73,16% на версии 4B и с 72,51% до 76,26% на версии 8B.
- Метод проверили на датасете ViRL39K и сравнили с эквивалентно настроенным (matched) OPSD, VCSD стабильно обходит его на моделях Qwen3-VL и Qwen3.5.
- VCSD не увеличивает затраты на инференс и не требует цепочек рассуждений (reasoning traces): вся дополнительная нагрузка приходится только на этап обучения.
Почему это важно
Обучение мультимодальных моделей понимать изображения обычно требует либо отдельной модели-учителя, либо вручную подготовленных «привилегированных» подсказок, правильных ответов или дополнительной визуальной разметки, которых нет у модели-ученика. Оба варианта усложняют и удорожают процесс обучения. VCSD показывает, что для самодистилляции достаточно контраста между ответом модели с картинкой и без неё, это упрощает обучение и одновременно точнее привязывает ответ модели к реальному содержимому изображения, а не к общим языковым догадкам, при этом не увеличивая расходы на инференс.
Кому это важно
Прежде всего, исследователям и инженерам, которые обучают и дообучают мультимодальные модели (в духе Qwen3-VL): метод снижает стоимость и сложность самодистилляции. Также полезно командам, которые строят на таких моделях визуальных агентов, помощников по документам, скриншотам или интерфейсам, для них точность привязки ответа к картинке напрямую влияет на качество продукта. Шире, всем, кто следит за развитием методов дистилляции и обучения мультимодальных моделей без дорогого внешнего учителя.
Как это применить
VCSD, метод для этапа обучения, а не готовый продукт: применить его может команда, которая уже обучает мультимодальную модель по схеме OPSD с моделью-учителем на основе EMA. Понадобится только возможность подавать модели два варианта одного и того же изображения, исходное и с «зачищенным» содержимым, на каждом шаге генерации ответа; отдельного набора привилегированных ответов или визуальной разметки не требуется. Материал не упоминает публикацию кода или весов моделей, поэтому перед внедрением в собственный пайплайн стоит проверить, появились ли они у авторов.
Можно ли доверять
Работа опубликована на Hugging Face Papers, площадке-агрегаторе препринтов, которая не заменяет рецензирование в журнале или на конференции; на момент публикации у неё 32 балла и 1 комментарий, то есть заметной внешней проверки сообществом она пока не прошла. В плюс говорит то, что цифры приведены не для одной модели, а последовательно для трёх размеров Qwen3-VL (2B, 4B, 8B) с одним и тем же набором из семи бенчмарков, это больше похоже на систематический эксперимент, чем на единичный удачный результат. Тем не менее пока это самостоятельно заявленные авторами цифры без независимого повторения, и относиться к ним стоит как к многообещающему, но предварительному результату.
Риски и подводные камни
Прирост качества неравномерный: +4,77 процентного пункта на версии 2B, но всего +1,86 на версии 4B и +3,75 на версии 8B, причина такого разброса в тексте не объясняется. Метод проверен только на моделях семейства Qwen (Qwen3-VL, Qwen3.5) и одном датасете ViRL39K, поэтому неясно, насколько результат перенесётся на другие архитектуры и задачи. Конкретный состав «семи бенчмарков» в доступном тексте не раскрывается, что затрудняет независимую проверку. И как у любого метода самодистилляции: если у модели-учителя на основе EMA есть системные слепые зоны или ошибки, контраст с «зачищенным» изображением не обязательно их устранит, учитель обучен на тех же данных, что и ученик.