Google DeepMind научила видеогенератор решать несколько задач компьютерного зрения

Исследователи Google DeepMind разработали GenCeption, систему, которая переиспользует предобученный видеогенератор для классических задач компьютерного зрения: оценки глубины, сегментации, определения нормалей поверхности, 3D-позы и других. В отличие от области языковых моделей, где одна модель научилась решать множество задач как побочный эффект предсказания следующего слова, компьютерное зрение до сих пор опирается на узкоспециализированные модели, например, «Segment Anything» для сегментации и «Depth Anything» для оценки глубины, каждая со своей архитектурой. Авторы статьи утверждают, что крупные модели генерации видео из текста способны закрыть этот разрыв: чтобы правдоподобно сгенерировать видео, модель должна понимать пространственную геометрию сцены, движение объектов и базовую физику, а обучение на текстовых описаниях связывает язык с визуальным содержанием.
GenCeption построена на открытой видеомодели Wan2.1 от Alibaba. Ключевое отличие от типичных диффузионных моделей, которые генерируют видео из шума за много маленьких шагов, GenCeption делает предсказание за один проход вперёд, что достаточно быстро для практических задач зрения. Любой результат, карта глубины, карта нормалей или маска сегментации, представляется как обычное RGB-изображение; движение камеры тоже кодируется как изображение. Какую задачу выполнять, модели сообщает текстовый промпт, как инструкция чат-боту. Для задач, не выдающих изображение (например, предсказание 3D-ключевых точек), добавлены отдельные обучаемые модули. Обучение всех задач идёт через единую функцию потерь на общих данных, а не через разные архитектуры под каждую задачу.
Большая часть обучающих данных, синтетический набор всего из 7500 видео: 800 моделей цифровых людей объединили с 200 последовательностями движений из датасета захвата движения и отрендерили в Blender с разными фонами и ракурсами камеры. Реальное видео использовалось только для сегментации по текстовым инструкциям. По данным исследования, GenCeption на этих скромных данных сравнялась или превзошла современные специализированные модели по многим бенчмаркам: оценки глубины на уровне DepthAnything 3, превосходство над NormalCrafter и Lotus-2 в оценке нормалей поверхности, превосходство над Genmo и TRAM в распознавании 3D-позы, а на сложной сегментации по текстовым описаниям, паритет со связкой Meta SAM 3 и Gemini 3.5 Flash. Модели вроде D4RT и VGGT Omega обучались на миллионах видео, GenCeption достигает сравнимых результатов, используя в 7, 500 раз меньше данных. При одинаковых условиях предобучение на генерации видео также обошло методы V-JEPA и VideoMAE V2; авторы связывают это с самой задачей генерации, а не только с объёмом данных, по их мнению, генерация видео заставляет модель выучивать полезные представления пространства и движения.
Хотя GenCeption обучалась почти исключительно на синтетических видео с одним человеком в кадре, она переносится на реальные видео с несколькими людьми и на категории, которых не было в обучении, животных и человекоподобных роботов; по данным исследования, часть результатов даже детальнее, чем рендеры Blender из обучающей выборки (сохраняются усы кошки, отдельные пряди волос). При этом совместное обучение всем задачам сразу ухудшает точность предсказания 3D-ключевых точек, исследователи полагают, что дополнительные модули для этой задачи мешают механизмам, выученным базовой моделью при предобучении. Вывод авторов: в архитектуру исходной модели стоит вносить как можно меньше изменений. Скорость тоже требует доработки: младшая модель обрабатывает видео из 81 кадра примерно за шесть секунд, старшая (14 млрд параметров), примерно за десять.
Авторы отвергают идею, что видеогенераторы, это только развлекательный инструмент, и утверждают, что такие модели уже содержат своего рода универсальную «мировую модель» (world model), которая может стать фундаментом для компьютерного зрения, по аналогии с ролью языковых моделей в обработке текста. Насколько это утверждение обосновано, предмет спора: международная исследовательская группа, недавно предложившая единое определение world model в проекте OpenWorldLib, прямо исключила из него модели генерации видео из текста, поскольку у них нет обратной связи с реальным миром. Бывший главный ИИ-исследователь Meta Ян Лекун идёт дальше и называет генеративные видеомодели тупиковым путём: альтернативный подход Meta V-JEPA 2 предсказывает абстрактные концепции, а не пиксели. Бенчмарк университета Цинхуа демонстрирует пределы предсказания пикселей: Sora 2, Seedance 2.0 и Veo 3.1 регулярно проваливали тесты на базовую физику и логику, даже когда результат выглядел убедительно. GenCeption использует генерацию видео для более узкой цели: исследователи не просят Wan2.1 предсказывать поведение мира, а извлекают из неё признаки для конкретных задач вроде оценки глубины и сегментации, где эти признаки превосходят специализированные системы. Параллельно Google DeepMind развивает другой подход, Genie 3, создающую интерактивные 3D-среды для обучения ИИ-агентов.
Ключевые факты
- Google DeepMind представила GenCeption, модель на базе открытого видеогенератора Wan2.1 (Alibaba), решающую несколько задач компьютерного зрения (глубина, сегментация, нормали поверхности, 3D-поза) одной архитектурой за один проход вперёд вместо многошаговой диффузии
- Обучена на синтетическом наборе всего из 7500 видео (800 цифровых людей + 200 последовательностей мокапа, отрендерены в Blender), в 7, 500 раз меньше данных, чем у моделей D4RT и VGGT Omega, обученных на миллионах видео
- На бенчмарках сравнялась или превзошла специализированные модели: DepthAnything 3 (глубина), NormalCrafter и Lotus-2 (нормали), Genmo и TRAM (3D-поза), связку Meta SAM 3 + Gemini 3.5 Flash (сегментация по тексту)
- Переносится на реальное многолюдное видео и категории вне обучения (животные, человекоподобные роботы); совместное обучение всем задачам ухудшает точность 3D-ключевых точек; обработка 81 кадра занимает 6, 10 секунд
- Авторы называют это подтверждением спорной идеи, что видеогенераторы уже содержат универсальную «мировую модель» для зрения, против этого высказываются проект OpenWorldLib, Ян Лекун (V-JEPA 2) и бенчмарк Цинхуа, показавший провалы Sora 2, Seedance 2.0 и Veo 3.1 на тестах физики
Почему это важно
Компьютерное зрение до сих пор не имело своего аналога «предсказания следующего слова», единого способа обучения, который сам по себе порождает универсальные навыки, как это произошло с языковыми моделями. Область держится на зоопарке узкоспециализированных моделей под каждую задачу. GenCeption, заявка на то, что предобученный видеогенератор уже неявно выучил геометрию, движение и физику сцены просто в процессе генерации правдоподобного видео, и это можно переиспользовать как единую основу для множества задач зрения сразу, а не обучать каждую с нуля.
Кому это важно
Исследователям и инженерам компьютерного зрения, которым сейчас приходится держать отдельные модели под каждую задачу (глубина, сегментация, поза, нормали); командам, работающим с ограниченными или дорогими в разметке данными, метод показывает конкурентные результаты на скромном синтетическом наборе; разработчикам робототехники и AR/VR, где нужна единая модель, надёжно переносящаяся на новые объекты и сцены.
Как это применить
GenCeption построена на открытой модели Wan2.1 от Alibaba, что делает подход воспроизводимым: любую выходную величину (глубину, нормали, маску сегментации) можно представить как RGB-изображение и получить текстовым промптом за один проход, без многошаговой диффузии. Для задач без изобразительного выхода (например, 3D-ключевые точки) добавляются отдельные обучаемые модули, но авторы советуют минимизировать изменения архитектуры базовой модели, избыточные надстройки мешают уже выученным механизмам. Обработка ролика из 81 кадра занимает 6, 10 секунд в зависимости от размера модели (до 14 млрд параметров), что стоит учитывать при оценке применимости к продакшн-сценариям.
Можно ли доверять
Работа, препринт от команды Google DeepMind с конкретными бенчмарками против известных специализированных моделей (DepthAnything 3, SAM 3, Genmo, TRAM и другие) и указанием объёма обучающих данных, что позволяет независимую проверку. При этом ключевой тезис работы, о видеогенераторах как универсальных «мировых моделях», прямо оспаривается другими исследовательскими группами: проект OpenWorldLib сознательно исключил text-to-video модели из своего определения world model, а бенчмарк университета Цинхуа показал, что топовые видеогенераторы (Sora 2, Seedance 2.0, Veo 3.1) систематически проваливают тесты базовой физики. То есть узкий инженерный результат (перенос признаков видеогенератора на задачи зрения) выглядит убедительно, а более широкая интерпретация («это мировая модель»), предмет открытого спора в самой индустрии.
Риски и подводные камни
Метод пока не универсален: совместное обучение всем задачам сразу ухудшает качество предсказания 3D-ключевых точек, что говорит об интерференции между задачами внутри одной архитектуры. Скорость обработки (6, 10 секунд на короткий ролик) далека от реального времени. Наконец, центральный аргумент статьи про «мировые модели» опирается на философски спорное определение, критики (включая Яна Лекуна) настаивают, что предсказание пикселей, тупиковый путь по сравнению с предсказанием абстрактных концепций (подход V-JEPA), и переносить выводы GenCeption на более широкие утверждения об «универсальном интеллекте» видеогенераторов стоит осторожно.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.