MaD-RL: новый метод обучения с подкреплением задаёт нейросети целевое распределение ответов

Обучение с подкреплением (RL) широко применяют при дообучении языковых моделей: оно максимизирует награду за каждый отдельный ответ, например оценку от бинарного верификатора или от модели вознаграждения, обученной на человеческих оценках. Авторы статьи отмечают, что для ряда задач этого мало. Генерация синтетических данных, выполнение ограничений, связанных со справедливостью, и исследование стратегий (policy exploration) требуют контролировать распределение ответов по множеству генераций, а не только повышать ожидаемую награду.

Для этого предложена общая RL-схема Distribution Matching (согласование распределений, в названии работы, MaD-RL). Она позволяет подогнать распределение скрытого категориального признака ответов модели под заданное целевое распределение.

Авторы эмпирически показывают, что господствующие рецепты дообучения, такие как Group Relative Policy Optimization (GRPO), снижают разнообразие ответов: вероятность политики концентрируется вокруг одной моды. Энтропийная регуляризация и температура сэмплирования могут расширить разброс распределения, но их эффективность ограничена: они работают только в пространстве токенов и только в сторону равномерного распределения.

Далее авторы показывают, что предыдущая работа в этой области, частный случай Distribution Matching с L2-расхождением. Для других расхождений, в частности KL и Йенсена, Шеннона (Jensen-Shannon), они предлагают собственные функции награды и подкрепляют их теоретическим обоснованием. Работоспособность подхода проверена на наборе экспериментов по математическим рассуждениям и программированию.

Ключевые факты

  • RL при дообучении языковых моделей обычно максимизирует награду за отдельные ответы, а для синтетических данных, ограничений справедливости и исследования стратегий нужен контроль распределения ответов по множеству генераций.
  • Предложена общая RL-схема Distribution Matching: распределение скрытого категориального признака ответов подгоняется под заданное целевое.
  • По наблюдениям авторов, GRPO снижает разнообразие ответов, сжимая вероятность политики к одной моде; энтропийная регуляризация и температура помогают лишь ограниченно.
  • Прежняя работа оказывается частным случаем метода с L2-расхождением; для KL и Йенсена, Шеннона предложены новые функции награды с теоретическим обоснованием.
  • Эксперименты проведены на задачах математических рассуждений и программирования.

Почему это важно

Стандартное дообучение с подкреплением оптимизирует среднюю награду и, по данным авторов, при этом сужает разнообразие выдачи: GRPO стягивает вероятность к одной моде. Если модель нужна для генерации синтетических данных, соблюдения ограничений справедливости или исследования стратегий, важна не только правильность отдельного ответа, но и то, как ответы распределены. Работа предлагает способ задавать это распределение напрямую.

Кому это важно

Исследователям и инженерам, которые дообучают языковые модели с помощью RL (в частности GRPO). Тем, кто генерирует синтетические данные и кому нужно разнообразие или заданные пропорции категорий в выдаче. Командам, которые решают задачи с ограничениями справедливости на уровне распределения ответов.

Как это применить

Практическая часть в аннотации описана только общо. Идея такова: выбрать скрытый категориальный признак ответов (например, тип решения), задать для него целевое распределение и использовать награду на основе расхождения между фактическим и целевым распределением. Для расхождений KL и Йенсена, Шеннона авторы предлагают отдельные функции награды. Конкретные настройки, гиперпараметры и возможный код нужно искать в полном тексте статьи.

Можно ли доверять

Это препринт на arXiv, и все утверждения принадлежат самим авторам. В аннотации нет количественных результатов, не названы бенчмарки, наборы данных и модели, использованные в экспериментах. Оценить масштаб улучшений по одной аннотации нельзя. Утверждение об эффективности пока подтверждено лишь заявлением авторов об экспериментах по математике и программированию.

Риски и подводные камни

Заявленные ограничения энтропийной регуляризации и температуры относятся к сравнению, проведённому самими авторами. Подход требует заранее определить скрытый категориальный признак ответов и целевое распределение, а от их выбора зависит результат. Насколько метод переносится за пределы математики и программирования, из аннотации не следует.

«Эмпирически мы показываем, что господствующие рецепты дообучения, такие как Group Relative Policy Optimization (GRPO), снижают разнообразие ответов, концентрируя вероятность политики вокруг единственной моды.»

— Из аннотации статьи MaD-RL на arXiv