Видео-нейросети теряют порядок кадров к выходу: метод TAI чинит это без обучения

Видеомодели на основе больших языковых моделей (VideoLLM) получают кадры по порядку и должны понимать, как содержимое меняется во времени. Но, как пишут авторы статьи, временные рассуждения остаются устойчивой слабостью таких архитектур. Показательный пример: если развернуть порядок кадров в ролике, то ответы, зависящие от времени, должны меняться на противоположные, однако итоговый прогноз модели часто остаётся прежним.
Чтобы понять, где возникает сбой, авторы вводят «вектор временного расхождения» τ_l: это послойная разница во внутренних представлениях модели, вызванная обращением временного порядка. Если отслеживать его величину по слоям, получается устойчивый профиль: расхождение достигает пика на промежуточных слоях и постепенно уменьшается к выходу. Авторы подтверждают, что этот пик специфичен именно для временных рассуждений и функционально важен для предсказаний. Отсюда вывод: VideoLLM получают временную информацию на промежуточных слоях, но не сохраняют её до выхода.
На этом наблюдении построен метод Temporal Activation Injection (TAI, «инъекция временной активации»). Для каждого входа он извлекает вектор τ_l в пике профиля и заново подмешивает его в последующие слои, следуя измеренному спаду. TAI не требует обучения. По заявлению авторов, он стабильно улучшает временные рассуждения на трёх VideoLLM и четырёх бенчмарках, а влияние на задачи без временной составляющей пренебрежимо мало. Код опубликован на GitHub: Youngwoo-git/Before-It-Fades.
Ключевые факты
- Если развернуть порядок кадров в видео, итоговый ответ VideoLLM часто не меняется, хотя должен.
- Авторы вводят вектор временного расхождения τ_l: послойную разницу представлений при обращении порядка кадров.
- Величина расхождения достигает пика на промежуточных слоях и постепенно падает к выходу; авторы подтверждают, что пик специфичен для временных рассуждений и важен для предсказаний.
- Метод TAI извлекает τ_l в пике и подмешивает его в последующие слои по измеренному спаду; обучение не нужно.
- По заявлению авторов, TAI улучшает временные рассуждения на трёх VideoLLM и четырёх бенчмарках с пренебрежимо малым влиянием на невременные задачи.
Почему это важно
Понимание времени и порядка событий в видео, слабое место видеомоделей: смена порядка кадров часто не меняет ответ. Работа указывает, где именно теряется временной сигнал: он формируется на промежуточных слоях, но затухает к выходу. Это сдвигает вопрос с «модель не умеет» на «модель умеет, но не доносит до ответа».
Кому это важно
Исследователям и инженерам, которые работают с видеомоделями и интерпретируемостью, а также командам, которым нужны более точные ответы о последовательности событий в видео.
Как это применить
Метод не требует обучения, а код выложен на GitHub (Youngwoo-git/Before-It-Fades), поэтому его можно попробовать на своей VideoLLM без дообучения. Какие именно модели и бенчмарки проверялись, в аннотации не названо, так что применимость к конкретной модели придётся проверять самостоятельно.
Можно ли доверять
Источник, аннотация научной статьи; все утверждения об эффекте исходят от самих авторов. Количественные результаты в тексте не приведены, поэтому величину улучшения оценить нельзя. Названия моделей и бенчмарков тоже не указаны.
Риски и подводные камни
Заявление о «пренебрежимом влиянии на невременные задачи» нужно проверять на своих данных. Из аннотации неизвестны ни слой пика и форма спада, ни дополнительные затраты на вывод, ни ограничения метода. Не ясно и то, насколько он переносится на другие архитектуры за пределами проверенных трёх.
«VideoLLM получают временную информацию на промежуточных слоях, но не способны сохранить её до выхода.»
— авторы статьи