Метод GPD улучшает пространственное мышление визуально-языковых моделей

Метод GPD улучшает пространственное мышление визуально-языковых моделей

Пространственное мышление остаётся слабым местом визуально-языковых моделей (VLM): RGB-изображение не даёт им напрямую геометрических свидетельств. По оценке авторов статьи, существующие способы лечения либо подмешивают 3D-данные в модель при её работе (инференсе), расплачиваясь изменением архитектуры и задержкой, либо обучают с наградой за результат, которая контролирует только итоговый ответ.

Авторы исходят из того, что пространственные ошибки рождаются на уровне восприятия: неверно оценённую глубину или направление можно исправить только истинной геометрией сцены. Эту геометрию, как отмечено в статье, уже содержат 3D-сканированные источники, из которых собираются обучающие корпуса для пространственных задач.

На этом построен метод GPD (Geometry-Privileged Distillation, «дистилляция с геометрической привилегией»). Он делает геометрические данные «привилегией» в самодистилляции по собственным траекториям (on-policy self-distillation, OPSD). Для каждого вопроса глубина, семантика и вид сверху (bird's-eye-view, BEV) превращаются в компактный текст и передаются учителю вместе с эталонным ответом. Привилегированная KL-дивергенция, применяемая только к неверным траекториям, дополняет GRPO. Развёрнутая модель при этом остаётся RGB-only, то есть при работе получает на вход одно RGB-изображение.

Результаты приведены для базовой модели (backbone) размера 4B: GPD набирает 57,1 на VSI-Bench и 37,6 в среднем по четырём другим тестам, MindCube, SPARBench, MMSI-Bench и ViewSpatial. По заявлению авторов, метод превосходит и обычный GRPO, и OPSD, где привилегией служит только ответ. Абляции (отключение отдельных частей метода) подтверждают три вещи: 3D-привилегия и привилегия ответа дополняют друг друга; маршрутизация подсказок под конкретный вопрос лучше, чем подача полного контекста; дистилляцию полезно ограничивать неверными траекториями.

Ключевые факты

  • GPD (Geometry-Privileged Distillation) отдаёт учителю в самодистилляции глубину, семантику и вид сверху (BEV) в виде компактного текста вместе с эталонным ответом.
  • Привилегированная KL-дивергенция применяется только к неверным траекториям и дополняет GRPO; развёрнутая модель остаётся RGB-only.
  • На базовой модели 4B заявлено 57,1 на VSI-Bench и 37,6 в среднем по MindCube, SPARBench, MMSI-Bench и ViewSpatial.
  • По заявлению авторов, GPD превосходит и GRPO, и OPSD, где привилегией служит только ответ.
  • Абляции показывают пользу маршрутизации под вопрос вместо полного контекста и ограничения дистилляции неверными траекториями.

Почему это важно

Пространственное мышление, слабое место визуально-языковых моделей, и обойти его обычно предлагают двумя путями: добавлять 3D в саму модель при работе или награждать только за итоговый ответ. GPD выбирает третий путь: геометрия используется лишь на обучении, как подсказка учителю, а рабочая модель остаётся RGB-only. Тем самым, по замыслу авторов, не нужно платить за изменения архитектуры и задержку при работе модели.

Кому это важно

Исследователям и командам, которые доучивают визуально-языковые модели на пространственных задачах: понимание расположения предметов, глубины, направлений, вида сверху. Подход затрагивает тех, кто уже использует GRPO и самодистилляцию и хочет получить более плотный сигнал, чем награда только за верный ответ.

Как это применить

Из описания метода следует схема: для обучающих вопросов брать истинную геометрию сцены из 3D-сканированных источников, превращать глубину, семантику и вид сверху в короткий текст, подавать его учителю вместе с эталонным ответом и добавлять привилегированную KL-дивергенцию к GRPO только на неверных траекториях. В аннотации не указано выпуска кода, модели или данных, поэтому готовой реализации по источнику назвать нельзя.

Можно ли доверять

Это препринт, и все цифры и выводы, заявления самих авторов из аннотации. Приведены результаты только для базовой модели 4B; оценки обычного GRPO и OPSD с привилегией ответа, а значит и размер улучшения, в тексте не названы, единицы измерения у 57,1 и 37,6 не указаны. Независимой проверки результатов в источнике нет.

Риски и подводные камни

Метод требует истинной геометрии сцены, поэтому применим там, где обучающие данные получены из 3D-сканов. Результаты показаны на одном размере модели (4B), и по тексту нельзя судить, сохранится ли выигрыш на других. Цифры по тестам нужно сравнивать с исходными значениями GRPO и OPSD, которых в аннотации нет; о затратах на обучение сведений тоже нет.