HKUST представила HOMIE, ИИ для точной вставки людей и предметов в видео

Персонализация видео с людьми и объектами (Human-Object Centric Video Personalization, HOCVP), задача, где генератор видео должен вставить конкретного человека и конкретный предмет в новую сцену так, чтобы оба сохранили узнаваемый вид, а их взаимодействие выглядело естественно. У существующих подходов две проблемы: во-первых, трудно одновременно сохранить точность внешнего вида и правдоподобность взаимодействия, особенно когда объект, не физическая вещь, а абстрактное понятие вроде логотипа компании. Во-вторых, даже когда есть дополнительные референсы одного и того же субъекта, например, карта расположения текста (OCR-карта) или снимки с разных ракурсов, большинство методов не умеет использовать эту связь между референсами для повышения точности.
Команда из 11 исследователей HKUST во главе с Yiyang Cai и Nan Chen предложила фреймворк HOMIE, который решает обе задачи в единой архитектуре и работает как с межсубъектной (разные люди и объекты в сцене), так и с внутрисубъектной (несколько референсов одного и того же субъекта) персонализацией. Ключевая идея, лучше интегрировать мультимодальную языковую модель (MLLM), которая «понимает» смысловые связи между референсами, не разрушая при этом управляемость текстового энкодера и не требуя дорогостоящей переобучаемой перестройки всей модели. Для этого авторы ввели два механизма: global multimodal guidance, согласование смысловых признаков MLLM с VAE-токенами видео через self-attention, и modality-reference embedding, разметку токенов по источнику (признаки MLLM, VAE-токены, токены внутрисубъектных референсов), которая связывает референсы друг с другом.
Модель обучена на данных, собранных на основе датасетов OpenS2V-5M и PhantomData: 300 тыс. примеров с одним субъектом, 80 тыс., с несколькими, 20 тыс. видео с разметкой масок сегментации и 40 тыс. клипов в разрешении 720p. Обучение потребовало около 11 тыс. GPU-часов на видеокартах A100, по словам авторов, заметно меньше, чем у методов, которые полностью заменяют текстовый энкодер и поэтому вынуждены переобучать всю систему заново. В своих экспериментах авторы сообщают о состоянии искусства по качеству видео, соответствию тексту и сохранению внешнего вида субъектов; в частности, точность распознавания текста на сгенерированном видео (OCR) выросла на 21,8% относительно сопоставимых базовых методов.
Продемонстрированные сценарии включают: сцены с несколькими людьми и разными предметами, вставку логотипа в видео без явного текстового описания этого логотипа, использование OCR-карт для точной передачи текста на объектах, согласованность внешнего вида объекта при съёмке с разных ракурсов и генерацию рекламных видео для продвижения товаров в разрешении 1280×720. Код и веса модели авторы выложили в открытый доступ, есть отдельная демо-страница проекта.
Ключевые факты
- HOMIE, фреймворк от команды HKUST (11 авторов), который объединяет межсубъектную и внутрисубъектную персонализацию видео с людьми и объектами в одной архитектуре
- Решает проблему прежних методов: либо теряется точность взаимодействия с абстрактными объектами вроде логотипов, либо не используются дополнительные референсы (OCR-карты, снимки с разных ракурсов)
- Два ключевых механизма, global multimodal guidance (согласование признаков MLLM и VAE-токенов через self-attention) и modality-reference embedding (разметка и связывание токенов по источнику)
- Обучена на смеси датасетов OpenS2V-5M и PhantomData (300 тыс. одно-субъектных и 80 тыс. много-субъектных примеров, 20 тыс. клипов с масками, 40 тыс. клипов в 720p); тренировка заняла около 11 тыс. GPU-часов на A100
- По заявлению авторов, метод достиг состояния искусства по нескольким метрикам, включая прирост точности OCR на видео на 21,8% относительно базовых решений
Почему это важно
Персонализация видео с людьми и объектами, узкое, но растущее направление генеративного видео: рекламные ролики, карточки товаров и контент для соцсетей требуют вставлять конкретного человека и конкретный товар или логотип в сцену так, чтобы оба остались узнаваемыми, а их взаимодействие выглядело правдоподобно. До HOMIE методы либо жертвовали точностью взаимодействия ради похожести объекта, особенно когда объект абстрактный, вроде логотипа, либо не умели пользоваться дополнительными референсами одного субъекта (OCR-картами, снимками с разных ракурсов) для повышения качества. HOMIE, по заявлению авторов, решает обе проблемы в одной архитектуре, не жертвуя управляемостью генерации текстовым описанием.
Кому это важно
Разработчикам инструментов генерации видео (аналогов Sora, Kling, Runway), которые хотят добавить функцию персонализации сцен; маркетологам и рекламным агентствам, которым нужно быстро собирать ролики с конкретным товаром или логотипом в разных сценах; исследователям мультимодальных моделей, как пример архитектуры, интегрирующей MLLM без переобучения текстового энкодера с нуля.
Как это применить
Метод построен на двух модулях. Global multimodal guidance встраивает смысловые признаки, извлечённые мультимодальной языковой моделью, в self-attention видео-генератора, согласовывая их с VAE-токенами кадров. Modality-reference embedding помечает токены по происхождению (из MLLM, из VAE, из внутрисубъектных референсов вроде OCR-карт или снимков с разных ракурсов) и связывает референсы одного субъекта между собой. Обучение прошло на смеси датасетов OpenS2V-5M и PhantomData (300 тыс. одно-субъектных и 80 тыс. много-субъектных примеров, 20 тыс. клипов с масками сегментации, 40 тыс. клипов в 720p) и заняло около 11 тыс. GPU-часов на A100. Авторы выложили код и веса модели в открытый доступ и опубликовали отдельную демо-страницу, метод можно проверить и использовать напрямую, не дожидаясь коммерческого продукта.
Можно ли доверять
Работа опубликована как препринт (страница на HuggingFace Papers собрала 47 очков и 2 комментария, скромная, но заметная реакция сообщества) от команды из 11 исследователей HKUST. Заявления о «состоянии искусства» и приросте точности OCR на 21,8%, это собственные измерения авторов по их же метрикам, независимого сравнения третьей стороной пока нет. При этом авторы открыли код, веса модели и отдельную демо-страницу с примерами, это позволяет любому желающему проверить результат самостоятельно, а не просто поверить на слово.
Риски и подводные камни
Заявленные метрики, собственные измерения авторов без независимой верификации; переносимость результатов на реальные продакшн-сценарии не гарантирована. Обучение потребовало около 11 тыс. GPU-часов на A100, ощутимый барьер входа для небольших команд, которые захотят воспроизвести или доработать метод. Возможность точно вставлять логотипы и абстрактные объекты в видео без явного текстового описания создаёт риск недобросовестного использования, от скрытой рекламы до манипулятивных композитов с реальными людьми и чужими брендами без согласия. Условия лицензирования кода и весов модели в доступных материалах не уточняются.