FAMOS: нейросеть находит подвижные части 3D-объектов по разреженным снимкам

FAMOS: нейросеть находит подвижные части 3D-объектов по разреженным снимкам

Исследователи представили FAMOS, модель для восстановления подвижности 3D-объектов (например, предметов с дверцами, ящиками, крышками) по разреженным, неупорядоченным облакам точек. Задача сложная: моделирование подвижных объектов по разреженным монокулярным наблюдениям затруднено тем, что каждое отдельное наблюдение раскрывает лишь часть геометрии и движения. По словам авторов, большинство существующих моделей прямого прохода (то есть работающих за один проход сети, без итеративной оптимизации) выводят подвижность объекта из одного-единственного наблюдения и поэтому сильно опираются на заученные априорные представления о форме объектов конкретной категории.

FAMOS вместо этого одновременно анализирует несколько частичных облаков точек и предсказывает по ним сегментацию подвижных частей объекта и параметры их шарниров (соединений). Модель совместно рассуждает сразу по нескольким наблюдениям и поддерживает переменное число входов, от одного вида до нескольких. Для объединения сведений о шарнирности между наблюдениями авторы предложили новую архитектуру, Multi-state Articulation Transformer, трансформер с чередующимися блоками внимания «по состояниям» (между разными наблюдениями одного объекта) и глобального внимания. Дополнительно они ввели целевую функцию обучения, которая супервизирует наблюдаемый диапазон движения каждой части объекта по всему набору входных наблюдений, это заставляет модель полнее использовать все доступные виды, а не полагаться на один.

Чтобы обойти нехватку масштаба и разнообразия существующих датасетов, авторы также построили процедурный генератор данных, который синтезирует самостоятельно размеченные 3D-объекты прямо в процессе обучения. В экспериментах на трёх датасетах, PartNet-Mobility, ACD и ArtiCraft-10K, FAMOS показал последовательное улучшение по сравнению как с другими моделями прямого прохода, так и с методами на основе итеративной оптимизации. Конкретные числовые показатели улучшения, состав авторов, их аффилиация, дата и место публикации в тексте аннотации не приведены.

Ключевые факты

  • FAMOS, модель прямого прохода, которая по разреженному неупорядоченному набору частичных 3D-облаков точек предсказывает сегментацию подвижных частей объекта и параметры их шарниров
  • Модель совместно анализирует несколько наблюдений сразу и поддерживает переменное число входов, включая один-единственный вид
  • Новая архитектура, Multi-state Articulation Transformer, чередует внимание «по состояниям» между наблюдениями и глобальное внимание
  • Новая целевая функция обучения супервизирует наблюдаемый диапазон движения каждой части объекта по всему набору наблюдений
  • Для обучения авторы построили процедурный генератор, синтезирующий самостоятельно размеченные 3D-объекты; на датасетах PartNet-Mobility, ACD и ArtiCraft-10K FAMOS последовательно превзошёл и другие модели прямого прохода, и методы на основе оптимизации

Почему это важно

Восстановление подвижности 3D-объектов, какие части двигаются и как, по неполным сканам сложно именно потому, что одно наблюдение показывает лишь часть геометрии и движения объекта. Существующие модели прямого прохода обычно опираются на единственное наблюдение и поэтому сильно зависят от заученных представлений о форме объектов конкретной категории, что ограничивает их точность и обобщаемость на новые формы. FAMOS решает это, совместно обрабатывая сразу несколько частичных наблюдений одного объекта вместо одного.

Кому это важно

Работа адресована исследователям и инженерам в области 3D-компьютерного зрения, компьютерной графики и робототехники, тем, кто восстанавливает подвижные части объектов (двери, ящики, крышки, шарнирные механизмы) по неполным сканам сцены, например для построения цифровых двойников, синтеза 3D-контента или восприятия сцены роботом.

Как это применить

Поскольку FAMOS, модель прямого прохода, а не итеративной оптимизации, она быстрее методов-конкурентов, работающих через оптимизацию, и при этом гибко принимает от одного до нескольких частичных наблюдений объекта. В тексте есть ссылка на страницу проекта (kevinqu7.github.io/famos), но сведений о цене, лицензии или доступности готового инструмента в источнике нет.

Можно ли доверять

Материал, аннотация научной публикации на Hugging Face Papers, результаты приведены только в виде утверждения авторов о «последовательном улучшении» на трёх датасетах (PartNet-Mobility, ACD, ArtiCraft-10K) над моделями прямого прохода и оптимизационными методами; конкретных числовых метрик, независимой проверки, состава авторов, аффилиации, места и даты публикации в доступном тексте нет, что сужает возможность самостоятельной оценки заявленного результата.

Риски и подводные камни

Аннотация не раскрывает ни точных цифр улучшения, ни масштаба процедурно сгенерированного датасета, ни данных об авторах и рецензировании, судить о результате можно только по формулировкам самих авторов. Это узкоакадемическая работа на стадии публикации, а не готовый инструмент или продукт.