RefCaptioner: новая модель ИИ точнее описывает видео по референсным снимкам

Тэнфэй Лю с соавторами описали новую задачу для видеомоделей, генерацию описаний видео с привязкой к нескольким референсным изображениям на уровне отдельных фраз (multi-reference image-grounded video captioning). Проблема, которую они решают: существующие модели субтитрирования видео пишут связный текст, но не умеют явно сопоставлять конкретные объекты и элементы кадра с внешними референсными снимками, из-за этого описания могут расходиться с реальным содержанием видео.
Для новой задачи авторы предложили RefCaptioner, двухэтапный фреймворк дообучения. Первый этап, SFT (supervised fine-tuning) на смешанных данных, второй, метод «Hierarchical Coverage-Discounted GRPO» (иерархическая версия group relative policy optimization со штрафом за неполное покрытие референсов). Вместе они учат модель одновременно: выбирать нужные референсные изображения, точно привязывать к ним фразы описания, отсеивать «отвлекающие» референсы, которые не относятся к делу, и сохранять согласованность между разными референсами, при этом не теряя базовое качество обычного описания видео без референсов.
Чтобы обучить и проверить модель, авторы собрали корпус из 20 000 видео и 171 354 референсных изображений, а также представили отдельный бенчмарк MRVBench, он оценивает фактическую точность подписей и качество мультиреференсной привязки как на реальных видео, так и на видео, сгенерированных ИИ.
По результатам экспериментов RefCaptioner показал лучший результат среди открытых моделей на новой задаче, оставаясь конкурентоспособным на стандартных бенчмарках субтитрирования видео (конкретные числовые показатели в источнике не приведены). Оценка людьми-разметчиками подтвердила, что подписи RefCaptioner предпочитают чаще, а их использование позволяет точнее восстанавливать исходное видео, как с открытыми, так и с проприетарными генераторами видео.
Ключевые факты
- Представлена новая задача, генерация описаний видео с привязкой конкретных фраз к нескольким референсным изображениям (multi-reference image-grounded video captioning).
- RefCaptioner, двухэтапный фреймворк дообучения: SFT на смешанных данных плюс Hierarchical Coverage-Discounted GRPO.
- Метод учит модель выбирать нужные референсы, привязывать к ним фразы, отсеивать «отвлекающие» изображения и сохранять согласованность между референсами.
- Для обучения и проверки собраны корпус из 20 000 видео и 171 354 референсных изображений и новый бенчмарк MRVBench.
- RefCaptioner, лучший результат среди открытых моделей на новой задаче; по оценке людей его подписи точнее восстанавливают исходное видео у открытых и проприетарных видеогенераторов.
Почему это важно
Обычные модели субтитрирования видео пишут гладкий текст, но не умеют явно указать, какой конкретно объект в кадре соответствует какому референсному изображению, из-за этого описания бывают неточными или расходятся с реальным содержанием. RefCaptioner закрывает этот разрыв: он впервые формализует задачу привязки описания к нескольким референсам на уровне фраз и предлагает метод обучения, который одновременно повышает фактическую точность подписи и её согласованность с референсами.
Кому это важно
Разработчикам систем субтитрирования и понимания видео, командам, которые строят или дообучают видеогенераторы (открытые и проприетарные) и нуждаются в точных, проверяемых описаниях исходного материала, а также исследователям, которым нужен новый бенчмарк (MRVBench) для сравнения моделей по фактической точности подписей.
Как это применить
Подход применим как рецепт дообучения: сначала SFT на смешанных данных, затем этап Hierarchical Coverage-Discounted GRPO, который штрафует модель за неполное покрытие референсов. По данным авторов, точные, привязанные к референсам описания, сгенерированные таким способом, затем можно использовать для более точного восстановления исходного видео через видеогенераторы, то есть как промежуточное звено в пайплайнах генерации и редактирования видео.
Можно ли доверять
Заявления опираются на эксперименты самих авторов (лучший результат среди открытых моделей на новой задаче, конкурентоспособность на стандартных бенчмарках) и на отдельную оценку людьми-разметчиками, которые предпочли подписи RefCaptioner и подтвердили, что они точнее восстанавливают видео. Источник не приводит конкретные числовые показатели превосходства и не указывает, прошла ли работа рецензирование за пределами публикации на HuggingFace Papers.
Риски и подводные камни
Задача, бенчмарк (MRVBench) и метод оценки предложены одной и той же командой, это типичная ситуация для новых исследовательских задач, но независимой проверки результатов пока нет. Источник не раскрывает деталей размера и устройства MRVBench, не называет конкретных цифр отрыва от других открытых моделей и не сообщает о планах публикации кода, весов модели или корпуса данных.