KaiNinja расширил TRELLIS.2 до генерации 3D-моделей по частям

Генеративные модели, которые строят 3D-объект сразу по одному изображению, например TRELLIS.2, дают высококачественную, но негерметичную геометрию с материалами. Проблема в том, что результат, цельный меш (полигональная 3D-модель), слитый в один объект. Дальнейшая работа с такой моделью, редактирование, риггинг (подготовка скелета для анимации) и физическая симуляция, требует, чтобы объект был разбит на отдельные части, а не оставался одним куском. Самое очевидное решение, прогнать готовый меш через отдельную сеть сегментации, работает медленно и настолько хорошо, насколько хороша сама сегментация.
Авторы работы (Жуйхань Юй с соавторами) объясняют, почему простое дообучение существующего генератора эту проблему не решает: в основе TRELLIS.2 лежит воксельное представление O-Voxel, где на каждую ячейку сетки приходится ровно одна поверхность, и на любом разрешении такое представление физически не способно описать стык, где соприкасаются две разные части объекта. Чтобы обойти это ограничение, авторы предлагают двухобъёмное представление и на его основе строят KaiNinja, расширение TRELLIS.2 до уровня отдельных частей. KaiNinja сохраняет исходные скорость и качество генерации TRELLIS.2, но выдаёт объект уже разбитым на соприкасающиеся части, без отдельной маски или сети сегментации в конвейере.
Обучающие данные KaiNinja собраны из источников разного рода, включая CAD-модели и детали, которые сгенерировал ИИ-агент на основе языковой модели (LLM). По формулировке авторов («насколько нам известно»), это первая генеративная 3D-модель, обученная на данных о частях, которые создал именно такой агент. Неожиданный результат эксперимента: точность воспроизведения целого объекта у KaiNinja оказалась выше, чем у той же базовой модели, дообученной на том же наборе данных, но без расширения до уровня частей.
В сравнении с конвейерами генерации частей других типов KaiNinja снижает расстояние Чамфера (Chamfer distance) для целого объекта на 40% и повышает строгую F-меру по частям на 16%. Оба числа, относительное улучшение против конвейеров сравнения, которые выбрали сами авторы; эти конвейеры в тексте не названы, абсолютные значения расстояния Чамфера и F-меры не приведены, а о выпуске кода или весов модели материал не сообщает.
Ключевые факты
- Генераторы 3D по одной картинке (например TRELLIS.2) выдают один слитый меш; дальнейшая работа, редактирование, риггинг, симуляция, требует отдельных частей, а прогон готового меша через сеть сегментации медленный и ограничен её точностью.
- Причина глубже нехватки данных: воксельное представление O-Voxel в TRELLIS.2 физически не может описать стык двух соприкасающихся частей ни на каком разрешении.
- Решение, двухобъёмное представление, на основе которого построен KaiNinja: расширение TRELLIS.2 до уровня частей без маски и без сети сегментации в конвейере, при той же скорости и качестве генерации.
- Обучающие данные включают CAD-модели и части, сгенерированные ИИ-агентом на основе языковой модели; по формулировке авторов, это первая генеративная 3D-модель, обученная на таких данных.
- Против конвейеров других типов KaiNinja снижает расстояние Чамфера для целого объекта на 40% и повышает строгую F-меру по частям на 16%, сами конвейеры сравнения и абсолютные цифры в материале не названы.
Почему это важно
Генераторы, которые превращают одну картинку сразу в 3D-объект, как TRELLIS.2, за последние версии заметно выросли в качестве геометрии и материалов. Но у них общее ограничение: на выходе один слитый меш, а не набор частей. Как только объект нужно не просто посмотреть, а использовать, отредактировать, подготовить скелет для анимации (риггинг) или просчитать физику, этот меш приходится резать на части вручную или отдельной сетью сегментации, а такой шаг медленный и настолько точен, насколько точна сама сегментация. KaiNinja называет точную техническую причину, почему это не решить простым дообучением: воксельное представление O-Voxel в основе TRELLIS.2 физически хранит только одну поверхность на ячейку сетки, поэтому стык двух соприкасающихся частей нечем описать ни на каком разрешении. Это ограничение самого формата данных, а не нехватки примеров для обучения, потому и потребовалось новое, двухобъёмное представление, а не просто больше размеченных частей в обучающей выборке.
Кому это важно
В первую очередь, студиям и инструментам, которым нужен не просто красивый 3D-объект, а рабочий актив: игровым и VFX-конвейерам, где модель нужно анимировать или разбирать на разрушаемые части, дизайнерам, которым нужно редактировать отдельные детали, не трогая остальное. Во вторую, исследователям генеративных 3D-моделей, особенно тем, кто уже работает с воксельными представлениями семейства TRELLIS. В третью, командам, которые ищут альтернативу ручной разметке 3D-частей: KaiNinja обучен в том числе на частях, которые сгенерировал ИИ-агент на основе языковой модели, и это отдельный интересный прецедент для тех, кто строит собственные конвейеры данных.
Как это применить
По описанию в статье, KaiNinja работает как прямая замена TRELLIS.2 в конвейере: тот же один кадр на входе, тот же воксельный бэкбон O-Voxel в двухобъёмном представлении, та же скорость и качество генерации, но на выходе объект уже разбит на части, которые соприкасаются друг с другом, и отдельно запускать или обучать сеть сегментации не нужно. Это убирает из продакшен-конвейера отдельный, медленный и по своей природе неточный шаг. Проверить это на практике пока негде: в материале нет ни слова о выпуске кода или весов модели, так что сегодня KaiNinja, это опубликованный результат исследования, а не инструмент, который можно скачать и запустить.
Можно ли доверять
Это исследовательская публикация в ленте статей Hugging Face, а не анонс готового продукта: в самом тексте не указаны ни авторы, ни организация, поэтому издание ссылается только на первого автора по данным страницы источника, Жуйхань Юй с соавторами. Оба заявленных результата, снижение расстояния Чамфера на 40% и рост строгой F-меры по частям на 16%, это относительное улучшение против «конвейеров генерации частей других типов», которые авторы не называют по имени; абсолютных значений метрик тоже нет, поэтому со стороны нельзя оценить, насколько сильными или слабыми были сами конвейеры сравнения. Формулировку про «первую модель, обученную на данных от ИИ-агента» авторы сами сопровождают оговоркой «насколько нам известно», это их собственная оценка, а не независимо подтверждённый факт. Проверить цифры независимо тоже не на чем: о выпуске кода или весов модели материал не сообщает.
Риски и подводные камни
Главный риск, непроверяемость цифр со стороны: и 40%, и 16% посчитаны относительно конвейеров, которые выбрали, но не назвали сами авторы, а абсолютных значений метрик в материале нет. Второй риск, часть обучающих данных сгенерировал ИИ-агент, а не человек или готовый CAD-каталог; это новый для 3D-генерации источник данных, и по самой статье невозможно оценить, насколько он чист и репрезентативен. Третий, KaiNinja жёстко привязан к воксельному представлению O-Voxel из TRELLIS.2, поэтому подход не обязательно переносится на генераторы с другой архитектурой. Наконец, о выпуске кода или весов модели ничего не сказано, так что независимо проверить результаты пока не на чем.