LLaMA-3-8B дообучили методом MeRLa, RLHF стал на 41% стабильнее

Reinforcement Learning from Human Feedback (RLHF, обучение с подкреплением на основе обратной связи от людей), стандартный способ выравнивать большие языковые модели с предпочтениями людей, но его качество упирается в статичные, не зависящие от задачи модели вознаграждения: они дают редкий и слабо информативный сигнал, из-за чего выравнивание получается неоптимальным.

Авторы работы предложили MeRLa (Meta-Learned Reward Shaping, мета-обученное формирование вознаграждения), метод, который ещё до основного RLHF-дообучения мета-обучает функцию Φ(x,y;φ), подстраивающую сигнал под конкретную задачу, на наборе вспомогательных задач. Итоговое, составное вознаграждение складывается из этой добавки и исходной модели вознаграждения так, что оптимальная политика (стратегия модели) не меняется, но модель получает более информативный, специфичный для задачи сигнал обучения. Мета-задача, на которой обучается сама функция Φ, объединяет три компонента: различение задач, регуляризацию энтропии и «потенциальное» сохранение сигнала (potential-based conservation), это нужно для устойчивой сходимости обучения. Авторы также приводят теоретические доказательства инвариантности оптимальной политики, разбирают чувствительность метода к дрейфу представлений (representation drift) и отдельно показывают, как избежать рассогласования стимулов, которое может возникнуть из-за максимизации энтропии.

Метод проверили на модели LLaMA-3-8B на четырёх бенчмарках и сравнили с PPO, DPO, GRPO и DAPO, во всех случаях MeRLa дал устойчивый прирост качества. На AlpacaEval 2.0 достигнут показатель length-controlled win rate (доля побед с поправкой на длину ответа) 90,8%, на MT-Bench, оценка 9.14, а нестабильность обучения снизилась на 41%. Авторы отмечают, что преимущества MeRLa сохраняются и при добавлении поверх процессных (process-based) и основанных на рубриках (rubric-based) улучшенных схем вознаграждения, то есть метод совместим с другими усовершенствованиями RLHF, а не заменяет их.

Ключевые факты

  • MeRLa (Meta-Learned Reward Shaping) мета-обучает функцию Φ(x,y;φ), подстраивающую вознаграждение под задачу, на вспомогательных задачах ещё до основного RLHF-дообучения
  • Составное вознаграждение сохраняет оптимальность политики и одновременно даёт более информативный, специфичный для задачи сигнал
  • Мета-цель объединяет различение задач, регуляризацию энтропии и potential-based сохранение сигнала, для устойчивой сходимости
  • На LLaMA-3-8B на четырёх бенчмарках MeRLa превзошёл PPO, DPO, GRPO и DAPO: 90,8% length-controlled win rate на AlpacaEval 2.0, оценка 9.14 на MT-Bench, на 41% меньше нестабильности обучения
  • Метод сочетается с process-based и rubric-based схемами вознаграждения; авторы дают теоретические гарантии инвариантности политики и разбирают риск рассогласования стимулов от максимизации энтропии

Почему это важно

RLHF, основной способ выравнивания больших языковых моделей с человеческими предпочтениями, но его слабое место, статичная, не привязанная к конкретной задаче модель вознаграждения: она даёт редкий и малоинформативный сигнал, из-за чего дообучение получается менее эффективным, чем могло бы. MeRLa решает эту проблему не заменой RLHF, а добавкой к нему: перед основным обучением метод отдельно мета-обучает функцию, которая формирует более точный, специфичный для задачи сигнал вознаграждения, сохраняя при этом теоретические гарантии, что оптимальная стратегия модели не меняется.

Кому это важно

Работа адресована исследователям и инженерным командам, которые занимаются выравниванием (alignment) больших языковых моделей и практическим применением RLHF, DPO, GRPO и похожих схем дообучения, то есть тем, кто настраивает модели вроде LLaMA под конкретные задачи и сталкивается с нестабильностью или недостаточным качеством обучения на этом этапе.

Как это применить

MeRLa встраивается как дополнительный этап перед основным RLHF-дообучением: сначала на вспомогательных задачах обучается функция формирования вознаграждения, затем она используется вместе с обычной моделью вознаграждения в паре с PPO, DPO, GRPO или DAPO. Авторы отдельно проверили, что метод не конфликтует, а сочетается с process-based и rubric-based схемами усиленного вознаграждения, то есть его можно добавлять поверх уже существующих пайплайнов дообучения, не переписывая их с нуля.

Можно ли доверять

Это препринт на arXiv, результаты пока не прошли рецензирование в независимом издании. Авторы подкрепляют метод не только экспериментами (LLaMA-3-8B, четыре бенчмарка, сравнение с четырьмя альтернативными схемами), но и теоретическим анализом: доказательством инвариантности оптимальной политики и разбором чувствительности к дрейфу представлений. Это увеличивает доверие к результату, но независимой проверки другими группами и воспроизведения на других моделях пока нет.

Риски и подводные камни

Эксперименты ограничены одной моделью (LLaMA-3-8B) и четырьмя бенчмарками, неясно, сохранится ли выигрыш на моделях другого размера или архитектуры. Мета-обучение отдельной функции формирования вознаграждения перед основным RLHF добавляет ещё один этап и вычислительные затраты. Сами авторы указывают на риск рассогласования стимулов из-за регуляризации энтропии как на известную опасность подобных схем, в MeRLa её пытаются нейтрализовать конструкцией мета-цели, но это делает метод сложнее для настройки и отладки, чем базовые PPO или DPO.

Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.