4DAnyone воссоздаёт любого человека в 4D по одному случайному видео

Авторы представили 4DAnyone, фреймворк для восстановления «4D-людей»: движущихся трёхмерных моделей человека, то есть 3D-формы, которая меняется во времени. Исходные данные, всего одно некалиброванное видео с одной обычной камеры, то есть случайная съёмка, для которой заранее не известны ни положение камеры, ни её параметры. Работу представили Yudong Jin с соавторами; полный список авторов и организация, стоящая за исследованием, в доступном тексте не указаны. Подход состоит из двух шагов: сначала система генерирует по исходному видео дополнительные ракурсы, новые видео, согласованные между собой и пригодные для реконструкции, а затем поднимает эти видео в 4D-представление методом 4D Gaussian Splatting (4DGS), который описывает сцену облаком трёхмерных гауссовых функций.
Проблема, которую решают авторы: существующие диффузионные видео-модели с управлением камерой (camera-controlled video diffusion) уже умеют правдоподобно генерировать видео с новых ракурсов, но перестают быть согласованными, когда ракурсов нужно много, а для реконструкции методом 4DGS их требуются десятки. Авторы называют причину «проблемой ограниченного контекста внимания» (bounded-attention-context problem): когда число нужных ракурсов превышает то, что модель успевает обработать за один прямой проход диффузионного трансформера (DiT), ракурсы приходится делить на группы, и это порождает два связанных узких места. Первое, на стороне референсного контекста: чем больше уже сгенерированных ракурсов система учитывает как условие для генерации следующих, тем быстрее растёт вычислительная нагрузка (сложность растёт как O(N), то есть линейно с числом ракурсов), и согласованность внешнего вида между ракурсами слабеет. Второе, на стороне целевого контекста: разные группы ракурсов обрабатываются раздельно и не могут напрямую обмениваться информацией друг с другом, из-за чего возникает общий структурный «дрейф», рассогласование геометрии по всей 4D-модели.
4DAnyone устраняет оба узких места двумя дополняющими друг друга механизмами. Reference Context Packing (RCP, «упаковка референсного контекста») сжимает накапливающиеся референсные ракурсы в контекст фиксированной длины со смешанным разрешением, за счёт этого сложность перестаёт расти с числом ракурсов и становится постоянной (O(1) вместо O(N)). Target Context Routing (TCR, «маршрутизация целевого контекста») по-разному перегруппировывает целевые ракурсы в процессе шумоподавления: на шагах с высоким уровнем шума группы обмениваются контекстом друг с другом, а на шагах с низким уровнем шума, стабилизируют уже наработанные детали.
Для обучения авторы собрали новый датасет MVGameHuman, созданный на собственном игровом движке, и объединили его с данными, снятыми в профессиональных студиях объёмной видеосъёмки (light stage), а также с видео, снятыми в естественных условиях (in-the-wild).
На тестовых наборах DNA-Rendering и DyMVHumans 4DAnyone превосходит предыдущие методы и по качеству генерируемого видео с новых ракурсов, и по итоговому качеству 4DGS-реконструкции, а также показывает устойчивую обобщающую способность на видео из реальных условий. Конкретные числовые показатели этого превосходства и названия методов, с которыми сравнивали 4DAnyone, в доступном тексте не приведены, сравнение описано только качественно. Видео-примеры результатов и исходный код авторы выложили на отдельной странице проекта: https://4danyone.github.io.
Ключевые факты
- 4DAnyone восстанавливает движущегося человека в 4D (3D-форму, меняющуюся во времени) по одному некалиброванному видео с одной обычной камеры, без каких-либо данных о положении и параметрах камеры.
- Подход двухшаговый: сначала система генерирует по исходному видео дополнительные ракурсы, которых не было в оригинальной съёмке и которые согласованы между собой, а затем поднимает их в 4D-представление методом 4D Gaussian Splatting (4DGS).
- Ключевая проблема прежних методов, «проблема ограниченного контекста внимания»: при делении нужных для 4DGS десятков ракурсов на группы возникают два узких места, рост вычислительной сложности учёта референсных ракурсов (O(N)) и невозможность обмена информацией между группами целевых ракурсов, что вызывает структурный «дрейф».
- Два новых механизма решают эту проблему: Reference Context Packing сжимает референсный контекст до фиксированной длины (сложность становится постоянной, O(1), вместо O(N)), а Target Context Routing перегруппировывает целевые ракурсы во время шумоподавления, обмениваясь контекстом на шагах с высоким уровнем шума и стабилизируя детали на шагах с низким.
- Для обучения собран новый датасет MVGameHuman на собственном игровом движке, объединённый с данными профессиональных студий объёмной съёмки и видео из реальных условий; на тестах DNA-Rendering и DyMVHumans 4DAnyone превосходит предыдущие методы, но точные цифры сравнения в тексте не приведены.
Почему это важно
4D-реконструкция человека по видео, одна из ключевых задач для цифровых аватаров, виртуальной примерки одежды, кино и игр, но диффузионные видео-модели с управлением камерой упирались в жёсткий потолок: они правдоподобно генерируют несколько новых ракурсов, но теряют согласованность, когда ракурсов нужно много, а для реконструкции методом 4D Gaussian Splatting (4DGS) их требуются десятки. 4DAnyone формулирует причину этого потолка, «проблему ограниченного контекста внимания», и снимает её сразу с двух сторон: Reference Context Packing убирает рост вычислительной сложности с числом ракурсов (была O(N), стала O(1)), а Target Context Routing чинит рассогласование между группами ракурсов. Это открывает дорогу к масштабированию видео-диффузионных методов реконструкции на столько ракурсов, сколько реально нужно для качественной 4D-модели, а не столько, сколько выдерживает архитектура.
Кому это важно
В первую очередь, исследователям и инженерам, которые занимаются 3D- и 4D-реконструкцией людей: разработчикам цифровых аватаров для игр, кино и VFX, системам виртуальной примерки одежды, AR- и VR-приложениям с реалистичными движущимися персонажами. Также, более широкому сообществу исследователей видео-диффузионных моделей и 4D Gaussian Splatting: предложенные механизмы решают общую архитектурную проблему масштабирования по числу ракурсов, а не только конкретно задачу реконструкции человека.
Как это применить
4DAnyone, исследовательская работа, но с практическим выходом: авторы выложили страницу проекта (https://4danyone.github.io) с видео-примерами результатов и исходным кодом, то есть подход можно попробовать воспроизвести самостоятельно, а не только прочитать о нём. Требования к исходным данным простые, одно некалиброванное видео с одной обычной камеры, то есть случайная съёмка без специального оборудования; результат, 4D Gaussian Splatting-модель, пригодная для дальнейшего рендеринга с любых ракурсов. Сведений о готовых весах модели, цене или условиях лицензии в доступном тексте нет.
Можно ли доверять
Материал, препринт с площадки Hugging Face Papers, независимое рецензирование в тексте не упомянуто. Авторы проверяют метод на двух признанных в индустрии тестовых наборах, DNA-Rendering и DyMVHumans, и утверждают превосходство над предыдущими методами и в качестве генерируемого видео, и в итоговой 4DGS-реконструкции, но конкретные числовые показатели этого превосходства в доступном тексте не приведены: сравнение описано только качественно. Не названы ни методы, с которыми сравнивали 4DAnyone, ни точное число ракурсов, использованных в тестах (в тексте, лишь общая формулировка «десятки ракурсов»), ни полный авторский коллектив, ни организация, стоящая за работой.
Риски и подводные камни
Главное ограничение источника, отсутствие количественных показателей: заявленное превосходство над прежними методами нельзя проверить по цифрам, а «десятки ракурсов», при которых прежние подходы теряют согласованность, не уточняются точным числом. Обучающий датасет MVGameHuman частично синтетический, собран на игровом движке, и хотя авторы утверждают устойчивую обобщающую способность на видео из реальных условий, независимой проверки этого утверждения в доступном тексте нет. Отдельный риск, не технический, а этический: чем проще становится восстановить реалистичную движущуюся 4D-модель человека по одному случайному видео, тем ниже порог для недобросовестного использования, создания цифровых двойников без согласия человека; сам источник эту тему не поднимает.