RefCaptioner: новая модель ИИ точнее описывает видео по референсным снимкам

RefCaptioner: новая модель ИИ точнее описывает видео по референсным снимкам

Тэнфэй Лю с соавторами описали новую задачу для видеомоделей, генерацию описаний видео с привязкой к нескольким референсным изображениям на уровне отдельных фраз (multi-reference image-grounded video captioning). Проблема, которую они решают: существующие модели субтитрирования видео пишут связный текст, но не умеют явно сопоставлять конкретные объекты и элементы кадра с внешними референсными снимками, из-за этого описания могут расходиться с реальным содержанием видео.

Для новой задачи авторы предложили RefCaptioner, двухэтапный фреймворк дообучения. Первый этап, SFT (supervised fine-tuning) на смешанных данных, второй, метод «Hierarchical Coverage-Discounted GRPO» (иерархическая версия group relative policy optimization со штрафом за неполное покрытие референсов). Вместе они учат модель одновременно: выбирать нужные референсные изображения, точно привязывать к ним фразы описания, отсеивать «отвлекающие» референсы, которые не относятся к делу, и сохранять согласованность между разными референсами, при этом не теряя базовое качество обычного описания видео без референсов.

Чтобы обучить и проверить модель, авторы собрали корпус из 20 000 видео и 171 354 референсных изображений, а также представили отдельный бенчмарк MRVBench, он оценивает фактическую точность подписей и качество мультиреференсной привязки как на реальных видео, так и на видео, сгенерированных ИИ.

По результатам экспериментов RefCaptioner показал лучший результат среди открытых моделей на новой задаче, оставаясь конкурентоспособным на стандартных бенчмарках субтитрирования видео (конкретные числовые показатели в источнике не приведены). Оценка людьми-разметчиками подтвердила, что подписи RefCaptioner предпочитают чаще, а их использование позволяет точнее восстанавливать исходное видео, как с открытыми, так и с проприетарными генераторами видео.

Ключевые факты

  • Представлена новая задача, генерация описаний видео с привязкой конкретных фраз к нескольким референсным изображениям (multi-reference image-grounded video captioning).
  • RefCaptioner, двухэтапный фреймворк дообучения: SFT на смешанных данных плюс Hierarchical Coverage-Discounted GRPO.
  • Метод учит модель выбирать нужные референсы, привязывать к ним фразы, отсеивать «отвлекающие» изображения и сохранять согласованность между референсами.
  • Для обучения и проверки собраны корпус из 20 000 видео и 171 354 референсных изображений и новый бенчмарк MRVBench.
  • RefCaptioner, лучший результат среди открытых моделей на новой задаче; по оценке людей его подписи точнее восстанавливают исходное видео у открытых и проприетарных видеогенераторов.

Почему это важно

Обычные модели субтитрирования видео пишут гладкий текст, но не умеют явно указать, какой конкретно объект в кадре соответствует какому референсному изображению, из-за этого описания бывают неточными или расходятся с реальным содержанием. RefCaptioner закрывает этот разрыв: он впервые формализует задачу привязки описания к нескольким референсам на уровне фраз и предлагает метод обучения, который одновременно повышает фактическую точность подписи и её согласованность с референсами.

Кому это важно

Разработчикам систем субтитрирования и понимания видео, командам, которые строят или дообучают видеогенераторы (открытые и проприетарные) и нуждаются в точных, проверяемых описаниях исходного материала, а также исследователям, которым нужен новый бенчмарк (MRVBench) для сравнения моделей по фактической точности подписей.

Как это применить

Подход применим как рецепт дообучения: сначала SFT на смешанных данных, затем этап Hierarchical Coverage-Discounted GRPO, который штрафует модель за неполное покрытие референсов. По данным авторов, точные, привязанные к референсам описания, сгенерированные таким способом, затем можно использовать для более точного восстановления исходного видео через видеогенераторы, то есть как промежуточное звено в пайплайнах генерации и редактирования видео.

Можно ли доверять

Заявления опираются на эксперименты самих авторов (лучший результат среди открытых моделей на новой задаче, конкурентоспособность на стандартных бенчмарках) и на отдельную оценку людьми-разметчиками, которые предпочли подписи RefCaptioner и подтвердили, что они точнее восстанавливают видео. Источник не приводит конкретные числовые показатели превосходства и не указывает, прошла ли работа рецензирование за пределами публикации на HuggingFace Papers.

Риски и подводные камни

Задача, бенчмарк (MRVBench) и метод оценки предложены одной и той же командой, это типичная ситуация для новых исследовательских задач, но независимой проверки результатов пока нет. Источник не раскрывает деталей размера и устройства MRVBench, не называет конкретных цифр отрыва от других открытых моделей и не сообщает о планах публикации кода, весов модели или корпуса данных.