SCOPD: самодистилляция возвращает качество ИИ при сжатии токенов

Модели, которые рассуждают по изображениям и видео (reasoning vision-language models), превращают картинку в длинную последовательность визуальных токенов, и это делает работу модели дорогой. Обычное решение, отбрасывать часть токенов без дообучения (training-free token pruning). Но при агрессивном сжатии качество резко падает; это принято объяснять необратимой потерей важной для задачи визуальной информации.\n\nАвторы статьи утверждают, что такое объяснение неполное. В анализе Pass@K при фиксированном контексте повторная выборка ответов из одного и того же урезанного визуального представления возвращает многие примеры, которые модель пропускала при жадном декодировании. По их словам, это указывает: полезные визуальные свидетельства остаются доступными, но модель использует их ненадёжно. Этот разрыв авторы назвали representation-utilization gap (разрыв между представлением и его использованием).\n\nИз этого наблюдения выросла методика SCOPD (sparse-context on-policy self-distillation), самодистилляция на собственных траекториях модели при разреженном контексте. Модель-студент генерирует цепочки рассуждений, видя только урезанные визуальные токены, а привилегированная модель-учитель с полным контекстом оценивает те же префиксы, которые сгенерировал студент. По заявлению авторов, SCOPD не требует эталонных ответов, изменений архитектуры и дополнительных вычислений на этапе инференса.\n\nВариант SCOPD+ использует небольшое вмешательство в визуальный бюджет, чтобы найти позиции в ответе, чувствительные к визуальной информации, и дистиллировать именно их.\n\nЦифры из аннотации: при сохранении 10% визуальных токенов исходная (Vanilla) модель удерживает 86,37% своей производительности без сжатия, по 13 бенчмаркам. SCOPD поднимает это значение до 90,49%, SCOPD+, до 92,43%. Все три числа выражены как доля от качества несжатой модели, а не как абсолютные баллы. Вывод авторов: эффективное рассуждение зависит не только от того, какая визуальная информация пережила сжатие, но и от того, насколько надёжно модель научена ею пользоваться. Этот вывод авторы подтверждают результатами на разных бюджетах токенов, бенчмарках и операторах сжатия.
Ключевые факты
- Авторы оспаривают объяснение, что сжатие визуальных токенов необратимо убивает нужную информацию: повторная выборка из того же урезанного представления возвращает многие пропущенные примеры (Pass@K).
- SCOPD: студент рассуждает по урезанным визуальным токенам, учитель с полным контекстом supervise-ит те же траектории; эталонные ответы, изменения архитектуры и дополнительные вычисления при инференсе не нужны.
- SCOPD+ с помощью небольшого вмешательства в визуальный бюджет выбирает чувствительные к картинке позиции ответа и дистиллирует только их.
- При 10% визуальных токенов удержанное качество по 13 бенчмаркам: Vanilla 86,37%, SCOPD 90,49%, SCOPD+ 92,43% (доля от несжатой модели).
- Итоговый тезис: важно не только, какая информация пережила сжатие, но и насколько надёжно модель научилась ею пользоваться.
Почему это важно
Визуальные токены, главная статья расходов при работе мультимодальных моделей с изображениями и видео. Работа предлагает другое объяснение падения качества при сжатии: информация не обязательно потеряна, модель просто плохо умеет пользоваться урезанным входом. Если это верно, часть потерь можно вернуть обучением, а не только выбором лучшего способа отбрасывать токены.
Кому это важно
Исследователям и инженерам, которые запускают модели, рассуждающие по картинкам и видео, и упираются в стоимость длинных последовательностей визуальных токенов. Также тем, кто занимается сжатием токенов и дистилляцией.
Как это применить
В аннотации методика описана концептуально: студент с урезанным контекстом, учитель с полным, обучение на собственных траекториях студента. Авторы заявляют, что метод не требует эталонных ответов, архитектурных правок и дополнительных вычислений при инференсе. Названий моделей, размеров, списка бенчмарков и сведений о релизе кода в аннотации нет, поэтому оценить затраты на воспроизведение по ней нельзя.
Можно ли доверять
Это аннотация научной статьи на Hugging Face Papers; все результаты, заявления самих авторов, независимой проверки в тексте нет. Аннотация не называет авторов и организации. Показатели приведены только как доля от качества несжатой модели при 10% токенов; абсолютных баллов нет. Прирост в 4, 6 процентных пунктов относительно Vanilla скромен, а полная картина по другим бюджетам и операторам сжатия в тексте не раскрыта.
Риски и подводные камни
В аннотации не указаны выигрыш в скорости или стоимости инференса и затраты на обучение SCOPD, поэтому практическая выгода неясна. Результаты приведены для одного уровня сохранения токенов (10%) и без конкретных моделей, так что переносимость на другие модели и задачи не подтверждена. Вывод о «разрыве использования» опирается на анализ Pass@K, который сам по себе не доказывает причину падения качества.