Self-Geometry: новый метод устраняет геометрические ошибки в 3D-моделях зрения без готовой разметки

Современные визуальные фундаментальные модели (VFM) вроде VGGT или DA3 за один проход предсказывают глубину, позу камеры и карту точек сцены, не требуя дообучения под конкретную сцену, и хорошо обобщаются на новые данные. Проблема в том, что явную геометрическую согласованность между несколькими видами сцены, например, через уравнивание связок (bundle adjustment), эти модели при обучении не получают: такой расчёт вычислительно слишком дорог, чтобы включать его в претрейн. Из-за этого предсказания разных видов одной сцены могут расходиться геометрически. Более ранние работы пытались исправить это на этапе инференса неявным способом, через самосогласованность самих выходов модели (карт точек, признаков), но такой сигнал слаб и почти не помогает там, где базовая модель ошибается сильно.
Авторы предлагают Self-Geometry, модуль адаптации, который подключается к уже обученной модели (plug-and-play) и задаёт геометрические ограничения между видами явно, используя 2D-соответствия пикселей как псевдо-эталонные данные вместо неявного сигнала. Пайплайн состоит из трёх частей. Geometric Disentanglement Optimization объединяет две функции потерь, Multi-View Consistency (согласованность между несколькими видами) и Epipolar Consistency (эпиполярная согласованность), и добавляет Gradient Disentanglement (разделение градиентов), чтобы эти два ограничения не мешали друг другу при обучении. Frame Angular-Neighbor, это способ выбирать пары видов для сравнения, основанный на геодезических расстояниях в группе вращений SO(3), чтобы ограничения накладывались мягко, без резких скачков. Lightweight TTA дообучает саму VFM-модель через LoRA, облегчённый способ адаптации без переобучения всех параметров.
Авторы сообщают, что метод даёт устойчивое улучшение оценки позы камеры и геометрии сцены сразу на шести VFM-моделях (VGGT, π³, DA3-Giant/Large/Base/Small) и четырёх бенчмарках (7Scenes, ETH3D, ScanNet++, HiRoom). Конкретных числовых значений прироста в источнике не приводится, только сам факт устойчивого улучшения по всем моделям и наборам данных.
Ключевые факты
- Self-Geometry, модуль test-time адаптации, который подключается к уже обученной VFM-модели (plug-and-play) и не требует переобучения с нуля.
- Вместо неявной самосогласованности выходов модели метод использует 2D-соответствия пикселей как псевдо-эталон для явных геометрических ограничений между видами.
- Состоит из трёх частей: Geometric Disentanglement Optimization (две функции потерь + разделение градиентов), Frame Angular-Neighbor (выбор пар видов по геодезическим расстояниям SO(3)) и Lightweight TTA (адаптация через LoRA).
- Проверен на шести VFM-моделях (VGGT, π³, DA3-Giant/Large/Base/Small) и четырёх бенчмарках (7Scenes, ETH3D, ScanNet++, HiRoom), авторы заявляют устойчивое улучшение оценки позы и геометрии.
- Числовой размер прироста в источнике не указан, только качественное «устойчивое улучшение» по всем моделям и наборам данных.
Почему это важно
VFM-модели предсказывают глубину, позу камеры и карту точек сцены за один проход без дообучения под сцену, но при этом не проверяются на геометрическую согласованность между разными видами: полноценный расчёт этой согласованности (уравнивание связок) слишком дорог, чтобы включать его в претрейн. В результате предсказания для разных ракурсов одной сцены могут не сходиться геометрически. Self-Geometry предлагает способ исправить это уже после обучения, не пересчитывая всю модель заново.
Кому это важно
Работа адресована тем, кто строит 3D-реконструкцию сцен, SLAM-системы, робототехнику и AR/VR-приложения на базе готовых VFM-моделей, VGGT, DA3 и подобных, и упирается в геометрические нестыковки между видами при использовании этих моделей на новых сценах.
Как это применить
Self-Geometry подключается к уже обученной VFM-модели как отдельный этап адаптации на этапе инференса (test-time), без переобучения всех параметров модели с нуля: тяжёлая часть адаптации идёт через LoRA, а ограничения между видами вычисляются по 2D-соответствиям пикселей и парам видов, отобранным по геодезическим расстояниям SO(3).
Можно ли доверять
Источник, научная работа (страница на Hugging Face Papers), исходный текст аннотации полный. Авторы в аннотации не названы поимённо, кроме первого автора со страницы, Сокхюна Юна (Seokhyun Youn) с соавторами. Заявленное улучшение, это самоотчёт авторов по результатам на шести моделях и четырёх бенчмарках, без указания конкретных цифр и без независимой проверки.
Риски и подводные камни
В источнике нет ни числового размера улучшения, ни сравнения с конкретными названными методами-конкурентами (только общее «прежние работы»), ни информации о выходе кода или релизе. Пока метод не проверен независимо и не сопровождается опубликованным кодом, его практическая применимость вне условий из статьи неясна.