Parallel Tube Decoding ускорил поиск объектов в видео в 79 раз

Исследователи представили метод Parallel Tube Decoding (PTD) для задачи пространственно-временной локализации объектов в видео (spatio-temporal video grounding, STVG), когда по текстовому описанию модель должна определить, в какой момент происходит нужное событие, и на всём этом интервале очертить рамкой (bounding box) целевой объект в каждом кадре.
Существующие мультимодальные большие языковые модели решают эту задачу авторегрессивно: предсказывают всю траекторию рамок последовательно, кадр за кадром. Из-за этого задержка вывода растёт вместе с длиной видеофрагмента ("тюбика" рамок), а ошибка локализации в одном кадре тянет за собой ошибки в следующих.
PTD устраняет обе проблемы, разбивая генерацию на два этапа: сначала модель одним блоком предсказывает временные границы события, затем, уже с учётом этих границ, параллельно, одновременно для всех кадров, генерирует пространственные рамки. Это убирает зависимость и на уровне отдельных токенов, и на уровне всей траектории: число последовательных шагов декодирования фиксировано и равно 1+1 раунду независимо от длины видеофрагмента.
Чтобы рамки для разных кадров можно было генерировать одновременно без потери качества, авторы предложили механизм Decoupled Block Attention: он сохраняет модели доступ к общему контексту видео и текстового запроса, но убирает зависимости между самими рамками разных кадров. Дополнительно применяется оптимизация политики с учётом качества локализации, отдельно для временных границ и для пространственной геометрии рамок.
На бенчмарке VidSTG метод сократил время полного построения тюбика рамок (Tube Completion Latency) в 79 раз и поднял пропускную способность пространственного декодирования в 92 раза по сравнению со стандартной авторегрессивной генерацией, и одновременно улучшил точность локализации, а не только скорость. Модель с компактным бэкбоном на 4 миллиарда параметров показывает хорошие результаты на VidSTG и HC-STVG и без дополнительного дообучения (zero-shot) переносится на смежные задачи: временную локализацию событий, видео-вопросы с привязкой к объекту (grounded VideoQA) и отслеживание объекта по текстовому описанию (referring video object tracking).
Ключевые факты
- Parallel Tube Decoding (PTD) заменяет авторегрессивную генерацию рамок объекта в видео на параллельную: сначала один блок для временных границ, затем одновременно все пространственные рамки
- Число последовательных шагов декодирования фиксировано на уровне 1+1 раунда и не растёт с длиной видеофрагмента
- На VidSTG задержка построения полной траектории рамок (Tube Completion Latency) снижена в 79 раз, пропускная способность пространственного декодирования выросла в 92 раза, при этом точность локализации выросла, а не упала
- Параллельность рамок обеспечивает новый механизм внимания Decoupled Block Attention, убирающий зависимости между рамками разных кадров, но сохраняющий общий контекст видео и запроса
- Модель с компактным бэкбоном на 4B параметров без дообучения переносится на временную локализацию, grounded VideoQA и отслеживание объекта по описанию
Почему это важно
Авторегрессивная генерация, стандартный подход для локализации объектов в видео мультимодальными моделями, но у него системная проблема: чем длиннее фрагмент, тем больше шагов декодирования и тем выше риск, что ошибка в одном кадре испортит всю последующую траекторию. PTD показывает, что для этой задачи авторегрессия, не необходимость: разбив генерацию на временной и пространственный блоки и убрав зависимости между рамками кадров, можно получить фиксированное число шагов декодирования независимо от длины видео и при этом не потерять, а улучшить точность.
Кому это важно
Разработчикам мультимодальных моделей и систем видеопоиска/видеоаналитики, где нужно быстро находить и отслеживать объект по текстовому описанию, модерация видео, поиск по видеоархивам, робототехника и системы наблюдения, где важна и точность локализации, и скорость ответа модели.
Как это применить
Работа описывает архитектурный приём, Decoupled Block Attention и разбиение генерации на временной и пространственные блоки, который применим к мультимодальным моделям, решающим задачи пространственно-временной локализации в видео. В источнике нет данных о выпуске кода или весов модели, поэтому пока метод стоит рассматривать как исследовательский результат, а не готовый к внедрению инструмент.
Можно ли доверять
Метод протестирован на двух признанных бенчмарках задачи (VidSTG и HC-STVG) и показал перенос без дообучения на три смежных задачи, что говорит в пользу воспроизводимости эффекта, а не подгонки под один тест. Абстракт не называет авторов и организации, не приводит абсолютных цифр точности (только относительное улучшение) и не сообщает о доступности кода или датасета, это ограничивает независимую проверку до появления полной публикации или репозитория.
Риски и подводные камни
Все ключевые цифры (79x, 92x), относительные показатели ускорения именно на VidSTG, а не абсолютные значения задержки или точности, так что прямое сравнение с другими методами по этим цифрам затруднено. Метрика точности заявлена как улучшенная лишь качественно, без конкретного числа. Без кода и весов результаты пока нельзя проверить независимо.
«Наши результаты показывают, что параллельная генерация тюбика рамок, эффективная и действенная альтернатива авторегрессивной локализации в видео.»
— авторы работы