V-Rubrics: рубрики вместо общей оценки учат VLM не выдумывать детали

V-Rubrics: рубрики вместо общей оценки учат VLM не выдумывать детали

Модели, работающие с изображениями и текстом (vision-language models, VLM), часто дают гладкие и убедительные ответы, которые на самом деле слабо привязаны к тому, что реально показано на картинке: один неподтверждённый объект, неверно прочитанное значение на графике или ошибочный промежуточный шаг рассуждения способны испортить иначе правдоподобный ответ. Авторы называют это проблемой распределения кредита (credit assignment) при пост-обучении мультимодальных моделей: скалярная награда «ответ принят / не принят», стандартная для обучения с подкреплением, не показывает, какие именно визуальные факты в ответе подтверждены, какие шаги рассуждения верны, а какие ограничения из инструкции нарушены.

Чтобы решить эту проблему, авторы предлагают Visual Rubrics-Based Reinforcement Learning (V-Rubrics), метод, который разбивает эталонные ответы на атомарные утверждения и оценивает сгенерированный моделью ответ по трём измерениям: визуальная достоверность (Visual Faithfulness), согласованность рассуждений (Reasoning Consistency) и следование инструкциям (Instruction Following). Полученные пункты рубрики дают модели структурированный частичный кредит и, когда в ответе есть подтверждающие фрагменты текста, локализуют этот кредит именно в них, а не размазывают по всему ответу.

Сначала команда получила отправной чекпоинт с контролируемым дообучением (SFT), дообучив модель Qwen3-VL-8B-Instruct на открытом корпусе OpenMMReasoner-SFT-874K, адаптировав рецепт данных для «холодного старта» из проекта OpenMMReasoner. Затем был собран обучающий набор V-Rubrics 50K из 50 248 примеров на основе 17 визуально обоснованных источников данных: сначала применили фильтры по заданным правилам, затем оценили сложность каждого примера по результатам отбора с отклонением (rejection sampling), после чего разметили каждый пример моделью Gemini-3-Pro по единому структурированному промпту и протоколу. На основе того же SFT-чекпоинта модель дообучили методом GRPO (Group Relative Policy Optimization) с покомпонентным, локализованным по префиксу ответа кредитом рубрик.

По результатам экспериментов, обучение с подкреплением на основе рубрик превзошло и исходный SFT-чекпоинт, и вариант GRPO, обучаемый только по итоговой оценке ответа целиком; наибольший выигрыш получен на бенчмарках, ориентированных на знания и на визуально обоснованные рассуждения. Конкретные числовые показатели прироста (баллы бенчмарков, проценты) в источнике не приведены, вывод сформулирован качественно.

Ключевые факты

  • V-Rubrics разбивает эталонный ответ на атомарные утверждения и оценивает модель по трём отдельным измерениям: визуальная достоверность, согласованность рассуждений и следование инструкциям, вместо одной общей награды.
  • Отправной SFT-чекпоинт получен дообучением Qwen3-VL-8B-Instruct на открытом корпусе OpenMMReasoner-SFT-874K.
  • Обучающий набор V-Rubrics 50K, 50 248 примеров из 17 визуально обоснованных источников, размеченных моделью Gemini-3-Pro по единому протоколу.
  • Дообучение методом GRPO с покомпонентным, локализованным по префиксу кредитом превзошло и SFT-базу, и GRPO по итоговому ответу; сильнее всего, на задачах, требующих знаний и визуального обоснования.
  • Числовые значения прироста качества (баллы бенчмарков, проценты) в источнике не раскрыты.

Почему это важно

Скалярная награда «ответ принят / не принят», стандартный сигнал для обучения моделей с подкреплением, не различает, какая часть развёрнутого ответа честно опирается на изображение, а какая додумана. Авторы называют это проблемой распределения кредита: единственная неподтверждённая деталь на картинке или неверно прочитанное число на графике способны испортить иначе убедительный ответ, а грубая награда этого не улавливает. V-Rubrics даёт более точный сигнал обучения, оценку по отдельным атомарным утверждениям вместо одной общей оценки всего ответа.

Кому это важно

Разработчикам и исследователям, которые обучают и дообучают модели, работающие с изображениями и текстом, для задач вроде описания графиков, визуальных вопросов-ответов и мультимодальных агентов, где важна не только гладкость ответа, но и его буквальное соответствие тому, что реально показано на изображении.

Как это применить

Рецепт воспроизводим по шагам: взять открытый корпус для этапа контролируемого дообучения (в статье, OpenMMReasoner-SFT-874K), собрать датасет с разбивкой ответов на рубрики (в статье, 50 248 примеров из 17 источников, размеченных Gemini-3-Pro по фиксированному протоколу) и дообучать модель методом GRPO с покомпонентным кредитом вместо единой награды за весь ответ. Цена, лицензия, доступность кода и весов модели в источнике не указаны.

Можно ли доверять

Материал, препринт на Hugging Face Papers; в самом тексте аннотации не названы ни авторы, ни институциональная принадлежность, известен лишь первый автор из метаданных площадки, Shulin Tian, с соавторами. Заявленное превосходство рубричного GRPO над базовыми вариантами в тексте не подкреплено конкретными числами, баллами бенчмарков или процентами прироста, вывод сформулирован качественно. Независимого рецензирования или воспроизведения результата третьей стороной источник не упоминает.

Риски и подводные камни

Часть обучающих данных (V-Rubrics 50K) размечена моделью Gemini-3-Pro, а не людьми, качество итоговых рубрик и, соответственно, обученной модели зависит от качества этой автоматической разметки; как именно проверялась сама разметка, в источнике не раскрыто, упомянут лишь «единый структурированный промпт и протокол». Без независимых числовых результатов оценить реальный масштаб улучшения качества по сравнению с обычным GRPO затруднительно.