Метод TT-VidT учит видеомодели видеть движение при меньших FLOPs

Авторы работы отмечают проблему сравнения методов самообучения на видео: часто оцениваются целиком готовые рецепты обучения, а не сам метод. Архитектура, целевая функция, объём увиденных данных, расписание обучения, масштаб и ёмкость декодера могут меняться одновременно. Из-за этого трудно понять, какие именно решения дают представления, ориентированные на движение, то есть такие, где выигрыш сосредоточен на изменениях между кадрами при сохранении полезной информации о внешнем виде.
Чтобы это исправить, авторы провели согласованное исследование из 4 × 6 = 24 сочетаний архитектуры и целевой функции. Масштаб энкодера, примерно 170, 190 млн параметров, данные, около 1,7 млн клипов из OpenVid и Moments-in-Time v2, обучение, 8 эпох. На этой основе предложен метод TT-VidT.
TT-VidT объединяет покадровый пространственный путь на основе ViT-B/16, инициализированного весами DINOv3, с компактным Temporal Transfer Layer (временным слоем переноса). Обучение идёт через Diff Compression: модель должна восстановить целевые кадры по опорному внешнему виду первого кадра и токенам движения, специфичным для каждого кадра.
Перебор конфигураций показал, что в самый чувствительный к движению режим попадает именно сочетание TT3D с Diff Compression, а не каждый из компонентов по отдельности. Абляции декодера говорят в пользу компактного декодера, предобученного на видео.
В итоговом сравнении, по заявлению авторов, TT-VidT одновременно лидирует при дообучении на Jester, Something-Something V2, ARID и Diving48. Улучшение относительно сильнейшей строки без TT составляет 54, 121%. При этом энкодер требует на 48% меньше FLOPs, чем DisMo, и на 55% меньше, чем VideoMAE или V-JEPA2. Результаты на HMDB51, IARD и EPIC-Kitchens, как сказано в аннотации, ограничивают это утверждение; подробности в аннотации не раскрыты.
Ключевые факты
- Проведено согласованное сравнение 24 сочетаний архитектуры и целевой функции (4 × 6) при энкодере примерно 170, 190 млн параметров, около 1,7 млн клипов OpenVid и Moments-in-Time v2, 8 эпох.
- TT-VidT сочетает покадровый путь ViT-B/16 с инициализацией DINOv3 и компактный Temporal Transfer Layer; обучение через Diff Compression, восстановление кадров по первому кадру и токенам движения.
- Лучший результат по движению даёт только сочетание TT3D с Diff Compression, а не каждый компонент отдельно; предпочтителен компактный декодер, предобученный на видео.
- Лидерство на Jester, Something-Something V2, ARID и Diving48 с улучшением на 54, 121% относительно сильнейшей строки без TT.
- Энкодер требует на 48% меньше FLOPs, чем DisMo, и на 55% меньше, чем VideoMAE или V-JEPA2; HMDB51, IARD и EPIC-Kitchens ограничивают заявление.
Почему это важно
Сравнения методов самообучения на видео часто смешивают несколько факторов сразу, поэтому непонятно, что именно даёт выигрыш. Здесь авторы строят контролируемое сопоставление 24 конфигураций и на его основе предлагают метод, ориентированный на движение между кадрами. Отдельно заметен вывод, что эффект даёт связка TT3D и Diff Compression, а не любой из компонентов сам по себе.
Кому это важно
Прежде всего исследователям предобучения видеомоделей и представлений движения, а также тем, кто выбирает между VideoMAE, V-JEPA2, DisMo и похожими подходами с оглядкой на вычислительную стоимость энкодера. Для задач, где важна динамика (жесты, действия, спортивные движения), результаты на Jester, Something-Something V2 и Diving48 могут быть ориентиром.
Как это применить
В аннотации не упомянуты код, веса или релиз, поэтому готового инструмента для использования нет. Практически применимы идеи: инициализация покадрового пути весами DINOv3, компактный временной слой и обучение через восстановление кадров по первому кадру и токенам движения. Для проверки на своих данных стоит опираться на полный текст работы.
Можно ли доверять
Все результаты, заявления авторов из аннотации. Абсолютные значения точности не приведены, только относительные улучшения; разбивки диапазона 54, 121% по бенчмаркам нет. Сама аннотация признаёт, что HMDB51, IARD и EPIC-Kitchens ограничивают утверждение, но не раскрывает, как именно. Независимой проверки в тексте нет.
Риски и подводные камни
Лидерство подтверждено на четырёх бенчмарках, а на трёх других (HMDB51, IARD, EPIC-Kitchens) заявление ограничено, так что метод не универсален. Выводы получены при конкретном масштабе энкодера (примерно 170, 190 млн параметров), на около 1,7 млн клипов и 8 эпохах обучения; перенос на другие масштабы в аннотации не обсуждается. Экономия FLOPs относится к энкодеру, а не ко всему конвейеру.