Алгоритм без ИИ не уступает специализированным моделям отбора кадров в видео

Учёные провели контролируемое исследование того, как мультимодальные языковые модели (MLLM) работают с длинными видео. Проблема в том, что модель не может просмотреть каждый кадр: час видео с частотой одного кадра в секунду даёт 3600 изображений, а система хранит и анализирует лишь небольшую фиксированную часть этого пула. Обычно то, какие именно кадры отбираются, считается технической деталью препроцессинга; авторы проверили, действительно ли это второстепенный вопрос.
Раньше сравнивать опубликованные методы отбора кадров между собой было сложно: разные работы одновременно меняют и способ оценки кадров, и границы текстового запроса, и политику разрешения изображения, и саму отвечающую модель, понять, что именно даёт прирост, было невозможно. Авторы зафиксировали все параметры, кроме одного, и по очереди варьировали три отдельных решения: отбор кадров, пространственное сжатие каждого кадра и реинвестирование сэкономленного на сжатии бюджета токенов. Проверка велась на шести не требующих обучения (training-free) правилах отбора кадров, трёх бенчмарках для длинных видео и двух разных отвечающих моделях.
Главный результат: отбор кадров, самый мощный из трёх рычагов. На часовом сегменте бенчмарка LongVideoBench восемь кадров, отобранных с учётом запроса, обошли по точности шестнадцать кадров, расставленных равномерно по времени, разрыв составил 6,9 балла. При этом алгоритм Orthogonal Matching Pursuit, неизменённый, десятилетиями существующий метод разреженной аппроксимации, изначально не создававшийся для видео, на всех трёх бенчмарках либо сравнялся со специально построенными под эту задачу селекторами, либо отстал от них не больше чем на балл.
Пространственное сжатие кадров оказалось почти бесплатным: уменьшение вдвое пространственного бюджета каждого кадра при тех же временных метках снижает точность максимум на 0,44 балла. Но само по себе сжатие смысла не имеет, выигрыш появляется только тогда, когда высвобожденный бюджет токенов тратится повторно: если вложить его в вдвое больше сжатых кадров при вычислительной цене не выше, чем у исходных восьми кадров, точность растёт ещё на два-три балла.
Отдельно авторы отмечают методическую находку: в их собственной реализации базового метода AKS обнаружился баг, а два разных программных стенда (harness), прогоняющие одни и те же опубликованные правила отбора при одинаковом бюджете токенов, дали разброс результатов от 0,07 до 3,74 балла. По мнению авторов, это показывает, что подобные сравнения методов нужно проводить внутри одного контролируемого стенда, а не сопоставлять цифры из разных статей.
Ключевые факты
- Час видео при частоте один кадр в секунду даёт 3600 изображений, из которых модель хранит лишь малую часть, какие кадры выбрать, обычно считается второстепенной технической деталью.
- На часовом сегменте LongVideoBench 8 кадров, отобранных с учётом запроса, обошли 16 равномерно расставленных кадров на 6,9 балла точности, отбор кадров оказался самым сильным из трёх проверенных рычагов.
- Алгоритм Orthogonal Matching Pursuit, неизменённый, десятилетиями существующий метод разреженной аппроксимации, на всех трёх бенчмарках сравнялся или отстал не более чем на балл от специализированных селекторов кадров.
- Сжатие пространственного бюджета кадра вдвое стоит максимум 0,44 балла точности, но окупается только при реинвестировании: вдвое больше сжатых кадров при той же вычислительной цене даёт ещё 2-3 балла.
- Баг в собственной реализации базового метода AKS и разброс 0,07-3,74 балла между двумя стендами на одинаковых правилах отбора показали авторам, что такие сравнения нужно проводить в одном контролируемом стенде.
Почему это важно
Индустрия строит всё более длинные видео-ИИ-системы, но то, как именно они выбирают кадры для анализа, обычно считается второстепенной инженерной деталью, а не предметом отдельного исследования. Эта работа показывает обратное: из трёх решений, отбор кадров, пространственное сжатие и реинвестирование бюджета токенов, именно отбор даёт наибольший разброс точности, и справиться с ним не хуже специализированных нейросетевых селекторов способен десятилетиями существующий алгоритм без всякого обучения.
Кому это важно
Разработчикам мультимодальных моделей для анализа длинных видео, систем видеонаблюдения, поиска по видеоархивам, разбора спортивных трансляций, которым приходится выбирать между дорогими обучаемыми селекторами кадров и простыми эвристиками. А также исследователям, сравнивающим методы отбора кадров между разными статьями и сталкивающимся с невоспроизводимыми числами.
Как это применить
Авторы дают практический порядок действий: сначала вложиться в качественный отбор кадров под конкретный запрос, пусть даже не обучаемым методом вроде Orthogonal Matching Pursuit, это даёт наибольший прирост точности; при нехватке бюджета токенов смело сжимать пространственное разрешение кадров, это стоит менее половины балла; а высвободившиеся токены не экономить, а сразу тратить на увеличение числа сжатых кадров, только тогда сжатие приносит реальную пользу.
Можно ли доверять
Это контролируемое сравнение внутри одного эксперимента: авторы зафиксировали все параметры, кроме проверяемого, и подтвердили выводы на шести правилах отбора, трёх бенчмарках и двух отвечающих моделях, что снижает риск случайного результата. При этом в доступном тексте не названы ни конкретные бенчмарки помимо LongVideoBench, ни отвечающие модели, ни авторы и их организация, ни место публикации, это ограничивает независимую проверку деталей без обращения к полному тексту статьи.
Риски и подводные камни
Авторы сами демонстрируют, как легко ошибиться в подобных сравнениях: баг нашёлся в их собственной реализации базового метода AKS, а два стенда, прогоняющие одинаковые опубликованные правила отбора при одном и том же бюджете токенов, разошлись на 0,07-3,74 балла. Это предупреждение и для читателей: цифры точности из разных статей про отбор кадров сравнивать напрямую нельзя, пока они не получены в рамках одного и того же контролируемого стенда.