UniMate: единая модель анимирует скелеты любой топологии

Автоматический риггинг уже умеет массово готовить 3D-модели к анимации, но сама генерация движения остаётся узким местом: существующие обучаемые аниматоры привязаны к конкретной топологии скелета, им нужны шаблоны под категорию персонажа либо дообучение и референсные движения под каждый отдельный скелет на этапе инференса.
Исследователи представили UniMate, единую базовую модель, которая синтезирует анимацию для скелета произвольной топологии по риггованному 3D-объекту и текстовому описанию, без оптимизации на этапе инференса и без дообучения под каждый скелет отдельно. В основе лежит топологически-осведомлённый диффузионный трансформер, который встраивает структуру скелета в механизм attention тремя способами: (1) attention-смещение, учитывающее граф скелета, построенное на попарных отношениях между суставами и геодезических расстояниях между ними; (2) спектральное вращательное позиционное кодирование, обобщение RoPE на произвольные кинематические деревья через лапласиан графа скелета; (3) глобальный топологический кондиционер, полученный attention-пулингом из скелета в исходной (rest) позе.
Для обучения модели собран новый датасет UniML3D, 13 006 последовательностей движения, охватывающих двуногих, четвероногих, птицеподобных, морских, насекомоподобных, змеевидных существ и артикулированные твёрдые объекты, с единой канонизацией и привязкой текстовых описаний к движениям.
Авторы заявляют, что обученная на этом датасете UniMate превосходит современные базовые модели по качеству, обобщающей способности и эффективности, конкретных цифр сравнения в аннотации при этом не приводится. Модель поддерживает zero-shot перенос между разными топологиями скелетов, достраивание движения между заданными позами (in-betweening), расширение анимации и редактирование движения по текстовому описанию.
Ключевые факты
- UniMate генерирует анимацию для скелета произвольной топологии по риггованному 3D-объекту и текстовому описанию, без дообучения под конкретный скелет и без референсных движений на инференсе.
- В основе, топологически-осведомлённый диффузионный трансформер: attention-смещение по графу скелета, спектральное обобщение RoPE через лапласиан графа и глобальный топологический кондиционер.
- Собран новый датасет UniML3D: 13 006 последовательностей движения для двуногих, четвероногих, птицеподобных, морских, насекомоподобных, змеевидных существ и артикулированных твёрдых объектов.
- Модель поддерживает zero-shot перенос между топологиями, достраивание движения между позами (in-betweening), расширение анимации и текстовое редактирование.
- Авторы заявляют превосходство над современными базовыми моделями по качеству, обобщающей способности и эффективности, но конкретных цифр сравнения в аннотации не приводят.
Почему это важно
До сих пор обучаемые модели генерации движения были привязаны к топологии скелета: под каждую категорию персонажа (человек, животное, механизм) нужен был свой шаблон, а под каждый новый скелет, отдельное дообучение и референсные движения. UniMate снимает это ограничение: одна модель работает с произвольной топологией скелета сразу, без переобучения под конкретный объект.
Кому это важно
Работа адресована студиям и разработчикам, которым нужна анимация для персонажей и объектов с нестандартным строением, не только людей и типичных четвероногих, но и птиц, морских существ, насекомых, змей и артикулированных механических объектов: игровым и VFX-студиям, инструментам для инди-разработки, симуляции и робототехнике, где заранее неизвестно, под какой скелет понадобится генерировать движение.
Как это применить
На входе, риггованный 3D-объект и текстовое описание нужного движения, на выходе, готовая анимация, без дополнительной оптимизации или дообучения под конкретный скелет. Модель также поддерживает перенос движения между разными топологиями «из коробки» (zero-shot), достраивание анимации между заданными ключевыми позами, продление (расширение) уже сгенерированного движения и его редактирование по новому текстовому описанию.
Можно ли доверять
Это исследовательская публикация с новой архитектурой и собственным датасетом (UniML3D, 13 006 последовательностей движения), а не готовый продукт. Авторы заявляют превосходство над современными базовыми решениями по качеству, обобщающей способности и эффективности, но в аннотации это утверждение качественное, конкретных цифр сравнения (метрик точности, скорости) там не приведено, так что судить о реальном отрыве по одной аннотации нельзя.
Риски и подводные камни
Заявленное превосходство над базовыми моделями пока не подкреплено числами в открытом описании работы, оценивать масштаб улучшения преждевременно. Не ясно, насколько хорошо модель обобщается на скелеты, сильно отличающиеся от семи категорий в обучающем датасете, и когда (и на каких условиях) станут доступны код, веса модели и сам датасет UniML3D, в описании это не указано.