TimeLens2: модель на 8 млрд параметров обошла ИИ с 397 млрд в поиске момента видео

TimeLens2: модель на 8 млрд параметров обошла ИИ с 397 млрд в поиске момента видео

Видео-модели с языковым интерфейсом (video MLLM) обычно неплохо рассказывают, что происходит в ролике, но почти не умеют указывать, в какой именно момент находится подтверждение их ответа. Исследователи во главе с Yuhan Zhu представили TimeLens2, модель, которая решает задачу «временной привязки» видео: для произвольного запроса она выдаёт набор временных интервалов-доказательств, причём их количество заранее не фиксировано и меняется в зависимости от длины видео, темы, формы вопроса и ракурса съёмки.

Авторы указывают, что существующие способы обучения плохо подходят под эту задачу. Разметка длинных видео обычно делается за один проход и получается ненадёжной, а вознаграждения для обучения с подкреплением либо не различают предсказания, которые не пересекаются друг с другом, либо требуют хрупкого пошагового сопоставления сегментов.

Чтобы обойти эти проблемы, TimeLens2 на всех этапах обучения работает с доказательствами как с набором интервалов, а не с отдельными метками. Под это построен собственный датасет TimeLens2-93K: сначала из подписей к видео формируются черновые предположения о моментах события, затем они независимо локализуются несколькими агентами, сверяются между собой, проходят смысловую проверку и уточнение границ.

Ключевая методическая новинка, темпоральное вознаграждение Вассерштейна: оно вычисляет точное одномерное расстояние Вассерштейна между равномерными распределениями по объединённым интервалам-доказательствам. Такой подход даёт плотную обратную связь без необходимости сопоставлять предсказанные и истинные интервалы один к одному и корректно работает, даже если их количество не совпадает или интервал разбит на несколько частей. Дополняет его метрика temporal IoU, которая точнее оценивает степень пересечения предсказанных и истинных интервалов.

На семи проверочных бенчмарках версия TimeLens2 с 2 миллиардами параметров обошла все модели сопоставимого размера, а версии на 4 и 8 миллиардов параметров показали лучший результат среди всех протестированных моделей, включая открытые модели с числом параметров до 397 миллиардов. По сравнению с базовыми моделями семейства Qwen3-VL, на которых построен TimeLens2, версии на 2, 4 и 8 миллиардов параметров улучшили метрику mIoU на 14,2, 13,0 и 18,1 пункта соответственно.

Ключевые факты

  • Видео-модели обычно описывают происходящее, но не указывают момент, TimeLens2 решает задачу «временной привязки»: выдаёт переменное число интервалов-доказательств для видео любой длины, темы, формы вопроса и ракурса.
  • Прежние методы обучения не подходят: разметка длинных видео за один проход ненадёжна, а награды для обучения с подкреплением либо не различают непересекающиеся предсказания, либо требуют хрупкого сопоставления сегментов.
  • Собственный датасет TimeLens2-93K построен в пять этапов: черновые предположения по подписям, независимая локализация, сверка между агентами, смысловая проверка и уточнение границ.
  • Новая метрика, темпоральное вознаграждение Вассерштейна, даёт плотную обратную связь без прямого сопоставления интервалов; дополняет её temporal IoU для точной оценки пересечения.
  • На всех семи бенчмарках версия на 2 млрд параметров обошла аналоги своего размера, а версии на 4 и 8 млрд достигли лучших результатов среди всех моделей, включая открытые модели с параметрами до 397 млрд; прирост mIoU над базовыми моделями Qwen3-VL, 14,2 / 13,0 / 18,1 пункта.

Почему это важно

Видео-модели с языковым интерфейсом всё активнее используют для поиска и анализа роликов, но большинство из них умеют только пересказывать содержание, не указывая, где именно в видео находится подтверждение ответа. Без точной привязки к моменту такие ответы сложно проверить, особенно на длинных видео, где нужный эпизод может занимать секунды из часового ролика. TimeLens2 нацелен закрыть именно этот разрыв: превратить описание видео в проверяемый ответ с точным временным доказательством.

Кому это важно

Разработчикам инструментов видеопоиска, вопросно-ответных систем по видео, модерации контента и криминалистического анализа записей, везде, где важно не просто понять, что происходит в ролике, но и точно найти момент. Отдельно, командам, которые уже строят продукты на базе моделей семейства Qwen3-VL: TimeLens2 показывает, каким приростом (до 18,1 пункта mIoU) можно улучшить именно эти модели за счёт специализированного обучения.

Как это применить

TimeLens2 выпущен в трёх размерах, 2, 4 и 8 миллиардов параметров, построен поверх моделей Qwen3-VL. В источнике не указаны цена, лицензия или условия доступа к весам модели, работа опубликована как исследовательская статья на Hugging Face Papers. Практически применимо не только само семейство моделей, но и методика: пятиэтапный конвейер разметки TimeLens2-93K и вознаграждение Вассерштейна можно переиспользовать для обучения других моделей задаче временной привязки.

Можно ли доверять

Все цифры, из самой статьи авторов, независимого подтверждения пока нет: материал опубликован на Hugging Face Papers (144 балла, 2 комментария), то есть находится на раннем этапе обсуждения, без рецензирования. При этом заявления конкретны и проверяемы, результаты приведены по семи стандартным бенчмаркам, указаны точные приросты метрики mIoU (14,2 / 13,0 / 18,1 пункта) и явное сравнение с моделями до 397 млрд параметров, что снижает риск голословности, но не заменяет независимую проверку.

Риски и подводные камни

Результаты пока не воспроизведены сторонними командами. Датасет TimeLens2-93K построен на автоматизированном пятиэтапном конвейере разметки, даже с этапами сверки и проверки такой подход может унаследовать систематические ошибки исходных подписей к видео. Сложность конвейера (независимая локализация, сверка между агентами, уточнение границ) затрудняет повторение методики другими командами. Наконец, в источнике нет информации об открытости весов модели или условиях использования, поэтому пока неясно, смогут ли другие разработчики применить TimeLens2 напрямую.