Метод GPD улучшает пространственное мышление визуально-языковых моделей

Пространственное мышление остаётся слабым местом визуально-языковых моделей (VLM): RGB-изображение не даёт им напрямую геометрических свидетельств. По оценке авторов статьи, существующие способы лечения либо подмешивают 3D-данные в модель при её работе (инференсе), расплачиваясь изменением архитектуры и задержкой, либо обучают с наградой за результат, которая контролирует только итоговый ответ.
Авторы исходят из того, что пространственные ошибки рождаются на уровне восприятия: неверно оценённую глубину или направление можно исправить только истинной геометрией сцены. Эту геометрию, как отмечено в статье, уже содержат 3D-сканированные источники, из которых собираются обучающие корпуса для пространственных задач.
На этом построен метод GPD (Geometry-Privileged Distillation, «дистилляция с геометрической привилегией»). Он делает геометрические данные «привилегией» в самодистилляции по собственным траекториям (on-policy self-distillation, OPSD). Для каждого вопроса глубина, семантика и вид сверху (bird's-eye-view, BEV) превращаются в компактный текст и передаются учителю вместе с эталонным ответом. Привилегированная KL-дивергенция, применяемая только к неверным траекториям, дополняет GRPO. Развёрнутая модель при этом остаётся RGB-only, то есть при работе получает на вход одно RGB-изображение.
Результаты приведены для базовой модели (backbone) размера 4B: GPD набирает 57,1 на VSI-Bench и 37,6 в среднем по четырём другим тестам, MindCube, SPARBench, MMSI-Bench и ViewSpatial. По заявлению авторов, метод превосходит и обычный GRPO, и OPSD, где привилегией служит только ответ. Абляции (отключение отдельных частей метода) подтверждают три вещи: 3D-привилегия и привилегия ответа дополняют друг друга; маршрутизация подсказок под конкретный вопрос лучше, чем подача полного контекста; дистилляцию полезно ограничивать неверными траекториями.
Ключевые факты
- GPD (Geometry-Privileged Distillation) отдаёт учителю в самодистилляции глубину, семантику и вид сверху (BEV) в виде компактного текста вместе с эталонным ответом.
- Привилегированная KL-дивергенция применяется только к неверным траекториям и дополняет GRPO; развёрнутая модель остаётся RGB-only.
- На базовой модели 4B заявлено 57,1 на VSI-Bench и 37,6 в среднем по MindCube, SPARBench, MMSI-Bench и ViewSpatial.
- По заявлению авторов, GPD превосходит и GRPO, и OPSD, где привилегией служит только ответ.
- Абляции показывают пользу маршрутизации под вопрос вместо полного контекста и ограничения дистилляции неверными траекториями.
Почему это важно
Пространственное мышление, слабое место визуально-языковых моделей, и обойти его обычно предлагают двумя путями: добавлять 3D в саму модель при работе или награждать только за итоговый ответ. GPD выбирает третий путь: геометрия используется лишь на обучении, как подсказка учителю, а рабочая модель остаётся RGB-only. Тем самым, по замыслу авторов, не нужно платить за изменения архитектуры и задержку при работе модели.
Кому это важно
Исследователям и командам, которые доучивают визуально-языковые модели на пространственных задачах: понимание расположения предметов, глубины, направлений, вида сверху. Подход затрагивает тех, кто уже использует GRPO и самодистилляцию и хочет получить более плотный сигнал, чем награда только за верный ответ.
Как это применить
Из описания метода следует схема: для обучающих вопросов брать истинную геометрию сцены из 3D-сканированных источников, превращать глубину, семантику и вид сверху в короткий текст, подавать его учителю вместе с эталонным ответом и добавлять привилегированную KL-дивергенцию к GRPO только на неверных траекториях. В аннотации не указано выпуска кода, модели или данных, поэтому готовой реализации по источнику назвать нельзя.
Можно ли доверять
Это препринт, и все цифры и выводы, заявления самих авторов из аннотации. Приведены результаты только для базовой модели 4B; оценки обычного GRPO и OPSD с привилегией ответа, а значит и размер улучшения, в тексте не названы, единицы измерения у 57,1 и 37,6 не указаны. Независимой проверки результатов в источнике нет.
Риски и подводные камни
Метод требует истинной геометрии сцены, поэтому применим там, где обучающие данные получены из 3D-сканов. Результаты показаны на одном размере модели (4B), и по тексту нельзя судить, сохранится ли выигрыш на других. Цифры по тестам нужно сравнивать с исходными значениями GRPO и OPSD, которых в аннотации нет; о затратах на обучение сведений тоже нет.