LOCI: гибридная память для видеомоделей мира экономит около 30% памяти

LOCI: гибридная память для видеомоделей мира экономит около 30% памяти

Статья посвящена задаче, которую авторы формулируют так: когда камера возвращается к ранее увиденной области, видеомодель мира должна воспроизвести то, что там было раньше. Для этого нужно и помнить прошлые наблюдения, и находить нужное для текущей точки обзора.\n\nУ двух привычных подходов к памяти есть слабые места. Кэш ключей и значений (key-value cache) сохраняет визуальные детали, но растёт вместе с длиной видео. Рекуррентная память компактна, но сжимает историю в состояние фиксированного размера, поэтому отдельные прошлые наблюдения становятся недоступны напрямую.\n\nАвторы предлагают LOCI, гибридную пространственную память, которая хранит оба представления. В половине блоков трансформера основное внимание держит кэш ключей и значений прошлых наблюдений. В другой половине оно ограничено текущим фрагментом (chunk) видео и дополнено рекуррентной памятью с линейным вниманием. Чтение из неё и запись в неё зависят от проективной геометрии камеры, поэтому точка обзора учитывается и при адресации памяти, и в сохранённом содержимом. Результаты чтения из рекуррентной памяти передаются в следующие блоки с кэшем и дают их запросам накопленный контекст сцены.\n\nПо утверждению авторов, на публичном бенчмарке памяти MIND и на отложенных записанных траекториях LOCI воспроизводит повторно увиденное содержимое точнее, чем представительные модели мира и модель с полным softmax-вниманием, обученная по тому же рецепту. При полной истории LOCI снижает пиковое потребление памяти при равной длине примерно на 30% относительно полного softmax. С ограниченным банком сохранённых наблюдений модель обрабатывает длинные видео при постоянном объёме памяти и при том же бюджете остаётся точнее полного softmax.

Ключевые факты

  • LOCI, гибридная пространственная память для потоковых видеомоделей мира: в половине блоков трансформера работает кэш ключей и значений, в другой половине, внимание только по текущему фрагменту плюс рекуррентная память с линейным вниманием.
  • Чтение и запись рекуррентной памяти зависят от проективной геометрии камеры, так что точка обзора учитывается и при адресации, и в хранимом содержимом.
  • При полной истории пиковая память при равной длине ниже примерно на 30% относительно полного softmax.
  • С ограниченным банком наблюдений длинные видео обрабатываются при постоянной памяти, а точность остаётся выше, чем у полного softmax при том же бюджете.
  • Преимущество заявлено на бенчмарке MIND и на отложенных записанных траекториях; числовых значений точности в описании нет.

Почему это важно

Видеомодели мира, которые генерируют сцену по мере движения камеры, должны быть согласованы во времени: при возврате в уже виденное место картинка не должна меняться. Кэш ключей и значений растёт с длиной видео, а рекуррентная память теряет доступ к отдельным наблюдениям. LOCI пытается совместить сильные стороны обоих подходов: заявлены более точное воспроизведение повторно виденного и снижение пиковой памяти примерно на 30% при полной истории.

Кому это важно

В первую очередь исследователям и разработчикам потоковых видеомоделей мира и систем, где важна пространственная согласованность при долгой генерации. Остальным работа пока интересна как направление: речь о статье с архитектурным решением, а не о готовом продукте.

Как это применить

Напрямую применять пока нечего: в описании не упомянуты ни код, ни выпуск модели. Практическая ценность, идея архитектуры: чередовать блоки с кэшем и блоки с рекуррентной памятью, зависящей от геометрии камеры, а для длинных видео ограничивать банк сохранённых наблюдений ради постоянного объёма памяти.

Можно ли доверять

Все заявления о качестве и экономии памяти принадлежат авторам статьи. В описании нет числовых показателей точности, не названы модели, с которыми сравнивали, не указаны размер банка наблюдений и длины тестовых видео. Названы бенчмарк MIND и отложенные записанные траектории. Оценить масштаб преимущества можно только по полному тексту статьи.

Риски и подводные камни

Снижение пиковой памяти примерно на 30% заявлено только для режима с полной историей относительно полного softmax; для режима с ограниченным банком указана лишь постоянная память без числовых данных. Сравнение с другими моделями мира дано качественно («точнее»). Данных о размере модели и обучающих данных в описании нет, поэтому перенос результатов на другие условия нужно проверять отдельно.