LayerRecall: маршрутизатор памяти по слоям для консистентности длинных видео

LayerRecall: маршрутизатор памяти по слоям для консистентности длинных видео

Модели, генерирующие длинное видео авторегрессионно (кусок за куском), держат в памяти только ограниченный недавний контекст, это ускоряет генерацию и сохраняет локальную плавность движения, но заставляет модель забывать персонажей, объекты, сцены и их признаки, если те исчезают из кадра и появляются снова позже. Существующие механизмы памяти дают модели доступ к удалённой (нелокальной) истории кадров, но сам по себе доступ к данным не гарантирует, что модель ими эффективно воспользуется.

Авторы проанализировали видео-DiT (диффузионный трансформер для видео) и обнаружили, что разные слои сети по-разному реагируют на текущий, недавний и удалённый контекст: одни слои чувствительны к дальней истории, другие, нет. Отсюда вывод: для качественной работы с длинной памятью нужно решать не только ЧТО извлекать из прошлого, но и КУДА, в какие именно слои, это подавать.

На основе этого наблюдения предложен LayerRecall, маршрутизатор памяти, обусловленный текущим состоянием генерации, который выборочно работает со слоями. Он извлекает релевантные исторические K/V-состояния (ключи и значения внимания из прошлых кадров) и вставляет их только в те слои базовой модели, которые оказались «чувствительны к памяти», не трогая остальные слои с их обычным локальным вниманием.

Чтобы обучить такой маршрутизатор без большого количества качественных длинных видео и без ручной разметки, куда именно нужно направлять память, авторы предложили метод обучения Cross-Horizon Prediction Matching (CHPM, «сопоставление предсказаний на разных горизонтах»): он использует привилегированную модель-ориентир с доступом ко всему длинному контексту, чтобы направлять обучение маршрутизатора с ограниченной памятью, сравнение идёт на уровне предсказаний, а не через размеченные метки.

Метод протестировали на 100 тестовых промптах с несколькими сценами (multi-shot). На бенчмарках MemoBench и MovieBench, которые оценивают консистентность длинных видео, LayerRecall показал лучшие результаты среди сравниваемых подходов; на VBench-Long результат совпал с базовой моделью без LayerRecall, то есть добавление памяти не ухудшило то, что и так работало хорошо, при этом заметно улучшив восстановление деталей на дальних промежутках. Конкретные числовые отрывы от конкурентов и базовой модели в тексте не приведены, сравнение описано качественно («лучшие результаты», «совпадает с базовой моделью»), без цифр.

В качественном анализе авторы отмечают эффект «самокоррекции, направляемой памятью»: если атрибут объекта временно «съезжает» (например, меняется деталь внешности), при повторном появлении он может вернуться к исторически верному виду, без сброса уже начатого движения или структуры сцены. Также сообщается, что LayerRecall переносится между разными базовыми архитектурами (cross-backbone portability) и добавляет незначительную вычислительную нагрузку при инференсе.

Ключевые факты

  • LayerRecall, маршрутизатор памяти для авторегрессионной генерации длинных видео: встраивает релевантные исторические K/V-состояния только в отдельные, «чувствительные к памяти» слои базовой модели, не трогая остальные
  • Анализ авторов показал: разные слои видео-DiT по-разному реагируют на текущий, недавний и удалённый контекст, важно решать не только что извлекать из памяти, но и в какие слои это подавать
  • Для обучения маршрутизатора без больших размеченных наборов длинных видео предложен метод CHPM (Cross-Horizon Prediction Matching), обучение по предсказаниям модели-ориентира с полным длинным контекстом
  • На 100 мультисценовых тестовых промптах LayerRecall показал лучшие результаты на бенчмарках MemoBench и MovieBench и не уступил базовой модели на VBench-Long; точные цифры отрыва в источнике не приведены
  • Метод переносится между разными базовыми архитектурами и, по заявлению авторов, почти не увеличивает время вывода

Почему это важно

Генерация длинного видео по частям, стандартный приём, но у него есть цена: модель помнит только недавнее и «забывает» персонажей и объекты, которые пропадали из кадра. LayerRecall предлагает не просто дать модели доступ к прошлым кадрам (это уже пробовали), а разобраться, в каких именно слоях сети такая память реально нужна и полезна, и вмешиваться туда точечно, не трогая остальную архитектуру. Это конкретный шаг к более длинным и связным видео без потери качества локального движения.

Кому это важно

В первую очередь, исследователям и инженерам, которые разрабатывают или дообучают модели генерации видео (видео-диффузия, видео-DiT), а также командам, которые строят инструменты для длинных видеороликов и multi-shot-сцен (несколько смен плана/локации в одном ролике). Широкой аудитории пользователей видеогенераторов эта работа пока напрямую не касается, это исследовательский компонент архитектуры, а не готовый продукт.

Как это применить

LayerRecall заявлен как переносимый между разными базовыми архитектурами (cross-backbone portability) и добавляющий, по словам авторов, незначительную нагрузку на инференс, то есть задуман как модуль, который в принципе можно встроить в существующий видео-DiT, а не как отдельную новую модель с нуля. Из текста не следует, что код или веса уже выложены в открытый доступ, публикация упоминает только метод и результаты экспериментов.

Можно ли доверять

Это исследовательская публикация (страница на HuggingFace Papers), но имена авторов и институциональная принадлежность в доступном тексте не приведены, доступна только аннотация. Результаты представлены как качественное сравнение («лучшие результаты», «совпадает с базовой моделью») на признанных в этой области бенчмарках (MemoBench, MovieBench, VBench-Long), но без конкретных числовых показателей отрыва от конкурентов, что затрудняет самостоятельную проверку масштаба улучшения.

Риски и подводные камни

Главное ограничение, отсутствие в источнике точных цифр: неизвестно, насколько именно LayerRecall лучше альтернатив на MemoBench и MovieBench, и что скрывается за формулировкой «незначительная нагрузка на инференс». Нет данных о релизе кода, весов моделей или датасета, поэтому независимая проверка результатов пока невозможна. Как и любая работа, использующая для сравнения собственные бенчмарки и метрики, результат стоит воспринимать с поправкой на то, что итоговую независимую оценку даст только практика применения в других лабораториях.