Mage-VL: модель для потокового видео экономит 75% токенов и ускоряет вывод в 3,5 раза

Mage-VL: модель для потокового видео экономит 75% токенов и ускоряет вывод в 3,5 раза

Senqiao Yang с соавторами описали проблему: обычные модели «текст+картинка» (VLM) страдают от парадокса Моравека, они хорошо справляются со сложными офлайн-рассуждениями по изображениям, но плохо и неэффективно обрабатывают простую задачу потокового восприятия видео в реальном времени. Для решения авторы представили Mage-VL, «кодек-нативную» потоковую мультимодальную модель для распознавания и взаимодействия в реальном времени.

Ядро подхода, собственный токенизатор Mage-ViT. Вместо равномерной выборки кадров (когда модель одинаково внимательно кодирует каждый кадр) он выборочно кодирует только динамичные, богатые изменениями участки видео, используя векторы движения и остаточную энергию между редкими опорными (I) и предсказанными (P) кадрами, идея, заимствованная из видеокодеков. Работая на уровне патчей 16×16 пикселей, такой подход снижает расход визуальных токенов более чем на 75%, сохраняя при этом пространственно-временной контекст.

Mage-ViT обучали с нуля на примерно 560 миллионах неразмеченных изображений и 100 миллионах неразмеченных видеокадров. По заявлению авторов, при таком объёме данных без разметки Mage-ViT сравнивается или превосходит флагманские энкодеры, обученные на миллиардах пар «изображение-текст». Для этого команда выстроила пайплайны данных AI4AI: совместную оптимизацию промптов и кода для мультимодального описания изображений (captioning) и ИИ-диагностику производительности, которая направляет выбор рецептов обучения.

Архитектурно Mage-VL построена по биоинспирированному принципу «двух систем»: лёгкий «шлюз событий» (System 1) отслеживает происходящее, а причинный декодер System 2 обрабатывает значимые события, это позволяет модели проактивно воспринимать потоковое видео, а не просто реагировать на запрос.

В тестах версия Mage-VL-4B сравнялась с Qwen3-VL-4B на статичных задачах и заметно превзошла её в понимании видео и в 2D/3D-рассуждении о пространстве, показав ускорение вывода до 3,5 раза. Также Mage-VL-4B полностью обошла базовую модель Phi-4-reasoning-vision с 15 миллиардами параметров. Помимо самой модели, авторы приводят семь эмпирических выводов: об эффективности данных предобучения, масштабировании по переменному разрешению, ускорении кодек-системы, избыточности дообучения на VideoQA, синергии движения и пространства, пайплайнах AI4AI и методе Zero-Vision SFT для мультимодального обучения с подкреплением.

Ключевые факты

  • Mage-VL, потоковая мультимодальная модель для распознавания видео и взаимодействия в реальном времени, решающая парадокс Моравека: слабость обычных VLM в простых потоковых задачах
  • Токенизатор Mage-ViT кодирует только динамичные участки кадра (векторы движения и остаточная энергия между опорными и предсказанными кадрами) и снижает расход визуальных токенов более чем на 75%
  • Mage-ViT обучен с нуля на ~560 млн неразмеченных изображений и 100 млн видеокадров и, по данным авторов, сравнивается или превосходит энкодеры, обученные на миллиардах пар «изображение-текст»
  • Mage-VL-4B сравнялась с Qwen3-VL-4B на статичных задачах, выиграла в понимании видео и пространственном рассуждении, ускорила вывод до 3,5 раза и обошла 15-миллиардную Phi-4-reasoning-vision
  • Архитектура построена на двух подсистемах, лёгком «шлюзе событий» и причинном декодере, что даёт проактивное (а не только реактивное) восприятие потока

Почему это важно

Обычные модели «изображение+текст» устроены так, что каждый кадр видео кодируется заново и одинаково подробно, это дорого и медленно для задач реального времени вроде понимания происходящего на лету. Mage-VL показывает инженерный путь снять это ограничение: заимствовать из видеокодеков идею кодировать только то, что меняется (движение, новые детали), а не весь кадр целиком. Результат, не просто чуть более быстрая модель, а сокращение визуальных токенов больше чем на три четверти при сохранении качества и заметном ускорении вывода (до 3,5 раза).

Кому это важно

В первую очередь, разработчикам мультимодальных систем и исследователям, которым нужно обрабатывать видеопоток в реальном времени: робототехника, ассистенты с камерой, системы наблюдения, интерактивные видеоприложения. Также интересно инженерам инфраструктуры инференса, экономия токенов напрямую снижает вычислительную стоимость и задержку при работе с видео.

Как это применить

Работа описывает архитектуру и обученную модель (Mage-VL-4B) с опубликованными результатами сравнения против Qwen3-VL-4B и Phi-4-reasoning-vision, а также семь эмпирических выводов о том, как эффективнее собирать данные и обучать подобные модели. Это может служить основой или ориентиром для тех, кто строит собственные потоковые мультимодальные системы, от выбора токенизации кадров до архитектуры «двух систем» для проактивного восприятия событий.

Можно ли доверять

Результаты представлены в виде научной публикации на HuggingFace Papers с описанием методики (объёмы данных предобучения, архитектура, сравнение с конкретными существующими моделями, Qwen3-VL-4B и Phi-4-reasoning-vision). Цифры по экономии токенов (более 75%) и ускорению (до 3,5 раза), заявления самих авторов; независимого воспроизведения результатов третьими сторонами в источнике не приводится.

Риски и подводные камни

Заявленные показатели получены авторами модели на выбранных ими бенчмарках, что типично для научных публикаций, но требует осторожности до независимой проверки. В тексте не раскрыты детали лицензии, доступности весов модели для скачивания и стоимости внедрения, судить о готовности решения к продакшену пока рано.