Qwen3.5-4B обогнала GPT-5.4 без учителя и разметки

Qwen3.5-4B обогнала GPT-5.4 без учителя и разметки

Дистилляция «на политике» (on-policy distillation) обычно требует асимметрии между моделью-учителем и моделью-учеником: либо учитель крупнее и сильнее ученика, либо ученику дают привилегированную информацию, эталонные ответы или размеченные области интереса на изображении. Авторы задались вопросом: откуда взять такую асимметрию, если ничего привилегированного нет? Ответ, развернуть источник асимметрии в обратную сторону. Вместо того чтобы добавлять учителю дополнительные знания, они отнимают информацию у ученика.

Так родился метод S²VOPD (Self-Supervised Visual On-Policy Distillation, самообучаемая визуальная дистилляция на политике). Учитель работает с оригинальным изображением, а ученик, с тем же изображением, но подвергнутым сильной аугментации (искажению). Распределение ответов учителя дистиллируется в ученика «на политике», то есть по действиям, которые сам ученик генерирует в процессе обучения. Это даёт тот же полезный обучающий сигнал, что и настоящий более сильный учитель, но без эталонной разметки, наград или отдельной более мощной модели.

Авторы систематически перебрали варианты аугментации изображений и выявили три закономерности: (1) асимметрия действительно важна, все четыре опробованные семьи аугментаций улучшают результат, а симметричная самодистилляция (без асимметрии) его, наоборот, ухудшает; (2) важна и сила искажения, точность модели максимальна при умеренной степени аугментации; (3) разрыв между учителем и учеником должен оставаться «по делу»: если аугментация полностью убирает из изображения информацию, нужную для ответа на вопрос, разрыв становится большим, но бесполезным для обучения.

На шести бенчмарках мелкой визуальной идентификации (fine-grained perception) метод поднял точность модели Qwen3.5-4B с 70,7% до 77,4%, это выше всех сравненных открытых моделей, вплоть до Qwen3-VL с 235 млрд параметров, и выше GPT-5.4. При этом объём обучающих данных не менялся, а метод воспроизвёл 96% того прироста точности, который дают методы с привилегированной информацией (эталонной разметкой).

Ключевые факты

  • Метод S²VOPD поднял точность Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках мелкой визуальной идентификации.
  • Результат превзошёл все сравненные открытые модели вплоть до 235-миллиардного Qwen3-VL и обошёл GPT-5.4.
  • Ключевая идея: не усиливать учителя, а ослаблять ученика, учитель видит оригинальное изображение, ученик, сильно аугментированную версию того же изображения.
  • Из четырёх опробованных семей аугментаций все улучшили результат, а симметричная самодистилляция без асимметрии, наоборот, ухудшила его; лучше всего работает умеренная сила искажения.
  • При том же объёме обучающих данных метод воспроизвёл 96% прироста точности, который дают методы с привилегированной разметкой.

Почему это важно

Дистилляция моделей обычно упирается в ресурс: нужен либо более мощный (и дорогой) учитель, либо размеченные эталонные ответы, которых часто просто нет. Эта работа показывает третий путь, тот же полезный обучающий сигнал можно получить, ослабив вход ученика (через аугментацию изображения), а не усиливая учителя. Это снимает зависимость от привилегированной информации и открывает самообучаемый маршрут к сильной дистилляции визуальных моделей.

Кому это важно

Тем, кто обучает и сжимает компактные визуальные и визуально-языковые модели: если под рукой нет модели-учителя крупнее целевой или размеченного датасета с эталонными ответами, метод даёт альтернативный источник обучающего сигнала. Полезен и исследователям, изучающим, из чего вообще состоит эффективная асимметрия учитель-ученик.

Как это применить

Рецепт метода: учителю на вход подаётся оригинальное изображение, ученику, то же изображение, но с сильной аугментацией; распределение ответов учителя дистиллируется в ученика «на политике». Силу аугментации нужно подбирать умеренной: слишком слабая не создаёт нужной асимметрии, слишком сильная стирает из изображения информацию, важную для ответа на вопрос, и разрыв между учителем и учеником становится бесполезным для обучения. Из четырёх проверенных авторами семей аугментаций работоспособны все, но не любая сила искажения.

Можно ли доверять

Материал, препринт (страница arXiv на HuggingFace Papers), без указания издания, статуса рецензирования или конкретных авторов и организаций в тексте аннотации. В аннотации не раскрыты объём обучающих данных и вычислительных ресурсов, поэтому воспроизвести результат по одному тексту нельзя. Цифры точности и сравнения с GPT-5.4 и Qwen3-VL, самоотчёт авторов, независимого подтверждения нет.

Риски и подводные камни

Метод чувствителен к силе аугментации, работает только в «умеренном» диапазоне, а слишком агрессивное искажение убирает из изображения именно ту информацию, что нужна для ответа, и обучающий сигнал становится бесполезным. Результаты получены на шести конкретных бенчмарках мелкой визуальной идентификации, неясно, насколько прирост переносится на другие типы задач. Сравнение с GPT-5.4 и открытыми моделями вплоть до Qwen3-VL 235 млрд параметров, цифры из самого препринта, без независимой проверки третьей стороной.