OraRL: новая RL-методика обучения видео-ИИ обошла GPT-5 и Gemini 3 Pro на VSI-Bench

Мультимодальные большие языковые модели (MLLM) стали основным подходом к унифицированному восприятию видео, но их дообучение методом обучения с подкреплением (RL) на больших многозадачных наборах данных остаётся трудным: существующие методы на политике (on-policy) собирают группы вариантов ответа (rollout), в которых мало по-настоящему качественных примеров, даже если для их генерации используется дорогая цепочка рассуждений (CoT). Авторы статьи предлагают метод OraRL и обученную на его основе модель Video-ORA-9B. Ключевая идея, использовать имеющуюся разметку не только для того, чтобы оценивать сгенерированные варианты ответа, но и как отдельный «эталонный» (oracle) вариант, который сам входит в группу на политике как прямая цель оптимизации. Прямое включение эталона оказалось нетривиальным: эталон с высокой наградой поднимает базовый уровень группы и переворачивает знак у изначально положительных преимуществ политики, авторы называют этот сбой «инверсией преимущества» (advantage inversion). Чтобы это обойти, в основе OraRL лежит раздельный оценщик преимущества: варианты ответа самой политики определяют базовый уровень без эталона, а разрыв между эталоном и политикой отдельно формирует направленный выигрыш и отсоединённое (detached) преимущество эталона. Дополнительно применяется «сбалансированная по знаку» отбраковка (sign-balanced pruning): в группе остаются только эталон и самые сильные варианты ответа каждого знака. За счёт этого шаг обучения OraRL занимает всего в 2,2 раза больше времени, чем шаг обычного дообучения с учителем (SFT), тогда как GRPO с цепочкой рассуждений требует в 4,9 раза больше времени. OraRL масштабируется и по размеру модели, и по объёму данных: он превосходит свою базовую модель на диапазоне размеров от 0,8 до 9 миллиардов параметров и обгоняет GRPO вплоть до 100 тысяч промптов. Без цепочки рассуждений Video-ORA-9B выдаёт ответ за 130 мс вместо 4780 мс, которые нужны при генерации с CoT. По сравнению с лучшими из предыдущих специализированных моделей, Video-ORA-9B поднимает временной mIoU с 62,5 до 66,0, метрику отслеживания AO, с 73,0 до 78,2, качество сегментации, с 64,3 до 70,4 и средний по трём тестам показатель пространственного интеллекта, с 51,0 до 56,1. На отдельном тесте VSI-Bench модель набирает 73,1 балла против 55,0 у GPT-5 и 55,1 у Gemini 3 Pro.
Ключевые факты
- OraRL включает разметку в группу вариантов ответа как отдельный «эталонный» rollout, а не только как способ оценки, это решает нехватку качественных примеров при RL-дообучении видео-MLLM.
- Раздельный оценщик преимущества устраняет «инверсию преимущества»: базовый уровень группы считается без эталона, а вклад эталона обрабатывается отдельно, направленный выигрыш и преимущество эталона не смешиваются.
- Шаг обучения OraRL занимает 2,2x времени обычного SFT, заметно быстрее, чем 4,9x у GRPO с цепочкой рассуждений (CoT).
- Video-ORA-9B без цепочки рассуждений отвечает за 130 мс вместо 4780 мс и при этом даёт более высокие результаты по mIoU, отслеживанию (AO), сегментации и пространственному интеллекту.
- На тесте VSI-Bench Video-ORA-9B набирает 73,1 балла, выше GPT-5 (55,0) и Gemini 3 Pro (55,1).
Почему это важно
RL-дообучение видео-MLLM дорого и неэффективно: существующие методы получают мало качественных вариантов ответа в группе на политике даже при дорогой генерации с цепочкой рассуждений. OraRL показывает, как ту же разметку, что раньше использовалась только для оценки, превратить в дополнительный полезный сигнал обучения, одновременно снижая вычислительные затраты, шаг обучения занимает 2,2x времени SFT против 4,9x у альтернативы с CoT.
Кому это важно
Исследователям и инженерам, которые дообучают мультимодальные модели для работы с видео, временная локализация, трекинг, сегментация, задачи пространственного интеллекта, а также командам, которые ищут более дешёвые способы RL-дообучения без потери качества.
Как это применить
Метод описан как техника пост-тренинга поверх базовой видео-MLLM. Работоспособность подтверждена на диапазоне размеров модели от 0,8 до 9 миллиардов параметров и на выборках вплоть до 100 тысяч промптов, что говорит о применимости к моделям разного масштаба. О публикации кода или весов Video-ORA-9B в тексте не сказано.
Можно ли доверять
Материал, препринт на HuggingFace Papers. В метаданных значится один автор, Yunheng Li, но это, вероятно, только первый автор, сам текст статьи не называет полный список соавторов, аффилиации и дату публикации. Приведённые цифры взяты из текста аннотации статьи.
Риски и подводные камни
Все результаты, собственные измерения авторов без указания на независимую проверку. Сопоставление с GPT-5 и Gemini 3 Pro приведено только по одному тесту, VSI-Bench, а не по широкому набору бенчмарков. В тексте нет данных о размере и источнике разметки, использованной для построения эталонных rollout, и нет сведений о стоимости или оборудовании обучения помимо относительных множителей времени шага.