MInTRL усиливает on-policy обучение с подкреплением точечными вмешательствами в генерацию

Обучение с подкреплением с проверяемыми наградами обычно ведут on-policy: обучающие примеры генерирует та же политика, которую в этот момент обучают, поэтому данные остаются близки к текущей модели, но диапазон доступных траекторий ограничен тем, что модель способна найти сама. Альтернатива, off-policy подходы вроде дообучения с учителем (supervised fine-tuning): они позволяют привнести внешние знания, которых нет в базовой модели, но чреваты большим сдвигом распределения между данными обучения и собственными ответами модели. Задача, которую ставят перед собой Минюй Чэнь с соавторами, расширить исследовательский охват (exploration), не потеряв при этом обучаемость (learnability).
Их решение, MInTRL, Minimal Intervention Reinforcement Learning (обучение с подкреплением с минимальным вмешательством). Метод расширяет границы исследования редкими точечными вмешательствами в траектории, которые в остальном остаются on-policy. Во время генерации ответа отдельная «политика-судья» периодически проверяет то, что выдаёт основная модель, заменяет ошибочные концовки короткими исправлениями и сразу возвращает управление основной политике, вмешательство точечное и короткое, а не полная замена траектории чужими данными. При обучении MInTRL использует целевую функцию уровня всей последовательности, основанную на регрессии преимущества (advantage regression), что позволяет обойтись без importance sampling, перевзвешивания примеров, которое обычно нужно, чтобы компенсировать разницу между политиками.
По данным авторов, такие точечные локальные вмешательства заметно расширяют охват по сравнению с обычным on-policy сэмплированием при ограниченном бюджете, но итоговые траектории в целом сохраняют on-policy природу. На задачах по математике и программированию MInTRL стабильно превосходит и стандартные on-policy, и off-policy базовые методы. Абляционные эксперименты показывают, что метод остаётся эффективным и при самокоррекции, когда роль судьи играет та же модель, и при разных вариантах политики-судьи, а лучший результат даёт умеренная, а не максимальная интенсивность вмешательств. Из этого авторы делают вывод, что минимальное вмешательство, рабочая парадигма для усиления on-policy обучения с подкреплением.
Ключевые факты
- MInTRL (Minimal Intervention Reinforcement Learning) точечно исправляет ошибочные концовки ответа модели прямо во время генерации: отдельная «политика-судья» подменяет неудачный фрагмент коротким исправлением и сразу возвращает управление основной модели.
- Обучение остаётся преимущественно on-policy, вмешательства редкие и локальные, а не полная замена траектории off-policy данными вроде SFT.
- Целевая функция, регрессия преимущества на уровне всей последовательности, которая убирает необходимость в importance sampling.
- На задачах по математике и программированию MInTRL стабильно обходит и on-policy, и off-policy базовые методы.
- Абляции показывают: подход работает и при самокоррекции, и с разными политиками-судьями, а лучший результат даёт умеренная, не максимальная интенсивность вмешательств.
Почему это важно
Обучение с подкреплением с проверяемыми наградами, один из основных способов дотягивать модели до сильных результатов в математике и программировании, но у него системная развилка: on-policy формат держит данные близко к текущей политике, однако не даёт выйти за рамки того, что модель способна найти сама, а off-policy данные (например, из SFT) добавляют внешние знания ценой большого сдвига распределения. MInTRL предлагает третий путь, не менять источник данных целиком, а точечно чинить отдельные неверные шаги внутри в остальном on-policy траектории. Это совмещает часть пользы off-policy знаний со стабильностью on-policy обучения и, по данным авторов, не требует importance sampling.
Кому это важно
В первую очередь, исследователям и инженерам, которые обучают reasoning-модели для математики и кода через RL с проверяемыми наградами и упираются в развилку между охватом (exploration) и обучаемостью (learnability). Также это касается команд, которые сейчас закрывают пробелы в возможностях модели дорогим SFT-дообучением и хотят сократить связанный с ним сдвиг распределения, не отказываясь от его преимуществ полностью.
Как это применить
Практический рецепт из статьи, добавить в цикл генерации отдельную «политику-судью», которая периодически проверяет черновой ответ и точечно подменяет неверную концовку коротким исправлением, не трогая остальную траекторию. По данным абляций авторов, роль судьи может играть даже сама обучаемая модель, то есть самокоррекция, и разные варианты политики-судьи тоже работают. А вот интенсивность вмешательств стоит держать умеренной: по наблюдениям авторов, максимально частая коррекция результат не улучшает, а умеренная, даёт лучший эффект.
Можно ли доверять
Материал, препринт, опубликованный на HuggingFace Papers (по сути зеркало arXiv); в тексте аннотации не назван ни полный состав авторов, ни организация, ни конкретные бенчмарки и числовые результаты, все оценки («стабильно превосходит», «заметно расширяет охват») пока идут от самих авторов и без опоры на цифры. Для практической проверки эффекта стоит дождаться полного текста работы с конкретными бенчмарками, цифрами и, если авторы их откроют, кода и данных.
Риски и подводные камни
Качество исправлений напрямую зависит от политики-судьи, а то, как она сама обучена и устроена, в тексте не раскрывается, это слепая зона метода. Интенсивность вмешательства нужно тщательно подбирать: по данным авторов, наилучший результат даёт умеренная частота правок, а не максимальная, то есть метод чувствителен к настройке и не работает по принципу «чем больше, тем лучше». Наконец, отдельная политика-судья в цикле генерации, это дополнительный компонент системы и, вероятно, дополнительные вычислительные затраты на каждом шаге обучения.