Where-OPD: мультимодальные нейросети учат видеть точнее на синтетических сценах

Where-OPD: мультимодальные нейросети учат видеть точнее на синтетических сценах

В статье предложен Where-OPD, вариант самодистилляции «на собственных ответах» (on-policy self-distillation) для мультимодальных больших языковых моделей (MLLM). Исходная идея: для улучшения рассуждений языковых моделей «ученика» обучают под надзором замороженной или EMA-версии (сглаженной усреднением весов) самого себя, которая получает привилегированную информацию. Для мультимодальных моделей, как отмечают авторы, такой подход пока почти не изучен.

Уже существующие подходы дают «учителю» привилегированную визуальную информацию, например фрагменты изображения (кропы), относящиеся к вопросу. По словам авторов, их выигрыш ограничен задачами, где помогает визуальное приближение, и они требуют либо размеченных людьми данных о привязке к областям изображения, либо внешних моделей-учителей.

Where-OPD устроен иначе. Учитель получает текстовую пространственно привязанную подсказку: какие визуальные элементы относятся к запросу. Для этого используются процедурно сгенерированные сцены, в которых идентификаторы объектов и их пространственные координаты известны автоматически, поэтому дообучение масштабируется и не требует ручной разметки. Учитель с помощью этой подсказки находит и объединяет свидетельства из нескольких релевантных областей изображения, а ученик учится воспроизводить такое поведение, видя только изображение и вопрос.

По данным авторов, подход стабильно улучшает результаты на бенчмарках по подсчёту объектов, пониманию документов и графиков на нескольких моделях. Хотя дообучение идёт только на синтетических сценах, улучшения переносятся на бенчмарки восприятия реальных изображений: средний прирост по CVBench, V*, ZoomBench, BLINK, HR-Bench и MME-RealWorld составляет 3,23 балла. Авторы делают вывод, что пространственно привязанная привилегированная информация способна развивать более широкие перцептивные способности и обеспечивает существенный перенос с синтетики на реальные данные за пределы задач и распределения данных, на которых шло дообучение. Страница проекта: github.com/sirkosophia/Where-OPD.

Ключевые факты

  • Where-OPD, самодистилляция на собственных ответах для мультимодальных LLM: учитель получает текстовую пространственную подсказку о нужных объектах, ученик видит только изображение и вопрос.
  • Обучение идёт на процедурно сгенерированных сценах, где идентификаторы и координаты объектов известны автоматически, без ручной разметки и внешних моделей-учителей.
  • Улучшения заявлены на бенчмарках подсчёта, понимания документов и графиков на нескольких моделях.
  • Несмотря на обучение только на синтетике, средний прирост на CVBench, V*, ZoomBench, BLINK, HR-Bench и MME-RealWorld, 3,23 балла.
  • Прежние подходы с кропами изображения, по словам авторов, помогают лишь задачам, выигрывающим от приближения.

Почему это важно

Самодистилляция на собственных ответах показала пользу для рассуждений текстовых моделей, а для мультимодальных почти не исследована. Where-OPD предлагает способ улучшать тонкое визуальное восприятие без ручной разметки: нужные сведения о сцене берутся из генератора синтетических изображений. Заявленный перенос на реальные бенчмарки, главный довод в пользу метода.

Кому это важно

Исследователям и инженерам, которые дообучают мультимодальные модели для подсчёта объектов, работы с документами и графиками, а также тем, кто ищет дешёвые источники обучающих данных вместо ручной разметки.

Как это применить

Из текста доступна только общая схема: сгенерировать сцены с известными объектами и координатами, дать учителю текстовую подсказку о релевантных областях, а ученика обучать воспроизводить ответ учителя по изображению и вопросу. Авторы указывают страницу проекта: github.com/sirkosophia/Where-OPD.

Можно ли доверять

Это описание результатов самими авторами; независимой проверки в тексте нет. Прирост 3,23 балла дан как средний по шести бенчмаркам, без разбивки по тестам и базовым значениям. Не указано, к одной ли модели или ко всем относится эта цифра, и какие именно модели использовались. Величина улучшений на подсчёте, документах и графиках не приведена.

Риски и подводные камни

Без названий моделей, размеров и объёма обучающих данных трудно оценить, насколько метод воспроизводим и насколько заметен прирост относительно базовых значений. Средний прирост в 3,23 балла может скрывать неравномерность по отдельным бенчмаркам. Перенос с синтетики подтверждён авторами лишь на перечисленных наборах.