SemanTok: токенизатор видео, с которым 201M-модель не уступает в 3,4 раза большей

Статья посвящена токенизаторам видео, компоненту, который превращает ролик в последовательность токенов для генеративных моделей. Современные видео-модели мира сочетают масштабируемость авторегрессионного (AR) предсказания с визуальным качеством диффузионных моделей, и от выбора токенизатора сцены сильно зависят и точность картинки, и семантика. Авторы исходят из гибких токенизаторов с переменной длиной и подходом «от грубого к детальному»: первые, грубые токены несут глобальную семантику клипа, а последующие уточняют детали.
По мысли авторов, у существующих гибких токенизаторов есть слабое место. Они применяют потерю выравнивания представлений (REPA) только к ранним скрытым состояниям декодера, а такую цель декодер может частично достичь за счёт своего зашумлённого входа, а не за счёт токенов.
SemanTok устроен иначе: в кодировщик подаются замороженные признаки DINO, а к нему добавлены лёгкие «головы», которые восстанавливают эти признаки по каждому сохранённому префиксу токенов, причём используя только сам префикс. Так семантику вынуждают нести именно токены.
Главный результат из аннотации: SemanTok даёт высокое семантическое соответствие и точность видео при любом размере AR-модели. AR-модель SemanTok на 201M параметров не уступает или превосходит AR-модель VideoFlexTok, которая в 3,4 раза больше, а более крупные AR-модели SemanTok дополнительно повышают точность. Токенизатор сохраняет семантическое соответствие на классах вне обучающего распределения и обеспечивает декодеру более высокое семантическое соответствие на любом уровне шума, включая чистый шум. Он хорошо справляется и с реконструкцией, и с генерацией; короткие префиксы токенов дешевле предсказывать, и они дают лучшую точность генерации, а пиксельные детали откладываются на более поздние токены.
Ключевые факты
- SemanTok, гибкий токенизатор видео с переменной длиной и подходом «от грубого к детальному»: первые токены несут глобальную семантику клипа, поздние уточняют детали.
- Идея: замороженные признаки DINO подаются в кодировщик, а лёгкие «головы» восстанавливают их по каждому сохранённому префиксу токенов.
- Критика прежних подходов: REPA-потерю применяют лишь к ранним скрытым состояниям декодера, и эту цель можно частично выполнить за счёт зашумлённого входа.
- По утверждению авторов, AR-модель SemanTok на 201M не уступает или превосходит VideoFlexTok AR, которая в 3,4 раза больше.
- Семантическое соответствие сохраняется на классах вне обучающего распределения и на любом уровне шума декодера, включая чистый шум.
Почему это важно
Видео-модели мира всё чаще строят на авторегрессионном предсказании токенов, а качество результата упирается в токенизатор. SemanTok предлагает способ сделать так, чтобы уже короткие префиксы токенов несли смысл сцены. По заявлению авторов, это позволяет модели на 201M параметров не уступать модели VideoFlexTok AR, которая в 3,4 раза больше, то есть получать сопоставимое качество при меньшем размере.
Кому это важно
Исследователям генерации видео и видео-моделей мира, а также командам, которые строят авторегрессионные и диффузионные модели поверх токенизаторов. Работа касается прежде всего архитектуры токенизатора и способа его обучения.
Как это применить
Напрямую применить результат пока нельзя: в аннотации не упомянут выпуск кода, моделей или данных. Идею можно взять как ориентир: подавать замороженные признаки DINO в кодировщик и добавлять лёгкие «головы», восстанавливающие эти признаки из каждого префикса токенов.
Можно ли доверять
Все сведения взяты из аннотации статьи и отражают утверждения самих авторов. Авторы и организации в тексте не названы, не указаны названия бенчмарков, наборов данных и метрик, нет численных оценок точности и семантического соответствия, а размер VideoFlexTok AR в параметрах не приведён, только соотношение 3,4 к 1. Сравнение «не уступает или превосходит» проверить по аннотации невозможно.
Риски и подводные камни
Аннотация не раскрывает версию DINO, размеры «более крупных» моделей SemanTok, затраты на обучение и вывод: утверждение «короче префиксы, дешевле предсказывать» дано только качественно, без цифр. Без таблиц результатов нельзя судить, насколько выигрыш устойчив на разных данных и метриках.