Parallel-RL: почему RL не создаёт конфликтов при мультизадачном обучении LLM, а SFT, создаёт

Авторы работы сравнили поведение двух подходов к обучению больших языковых моделей (LLM) сразу на нескольких задачах, Supervised Fine-Tuning (SFT, дообучение с учителем) и Reinforcement Learning (RL, обучение с подкреплением). В предварительных экспериментах они обнаружили: при многоэтапном обучении SFT страдает от серьёзных конфликтов между задачами, тогда как RL позволяет задачам стабильно сосуществовать друг с другом.
Чтобы объяснить это различие, авторы проследили эффект до уровня параметров модели и показали, что RL порождает разрежённые и приблизительно ортогональные (почти не пересекающиеся по направлению) обновления параметров для разных задач. Теоретическое объяснение строится на анализе интерференции градиентов между задачами. Ключевой вывод: интерференция в SFT ограничена нормой, растёт вместе с абсолютной величиной градиента, тогда как интерференция в RL ограничена дисперсией, она задаётся дисперсией градиента, которая возникает из-за нормализации преимущества (advantage normalization) и обучения по актуальной политике (on-policy optimization). Именно эта малая граница дисперсии и даёт почти ортогональные направления оптимизации для разных задач.
Опираясь на это наблюдение, авторы предлагают новую парадигму, Parallel-RL, которая разделяет (декаплирует) обучение на разные задачи и, по их утверждению, значительно повышает эффективность и гибкость процесса. Численных результатов, деталей экспериментальной методики, датасетов или сравнения производительности Parallel-RL с другими подходами в тексте не приведено.
Ключевые факты
- SFT сталкивается с конфликтами между задачами при многоэтапном мультизадачном обучении LLM, а RL позволяет задачам сосуществовать стабильно
- На уровне параметров RL порождает разрежённые, почти ортогональные обновления для разных задач
- Интерференция при SFT ограничена нормой градиента, при RL, его дисперсией (из-за нормализации преимущества и on-policy оптимизации), отсюда почти ортогональные направления оптимизации
- На основе этого наблюдения авторы предлагают Parallel-RL, парадигму, которая разделяет мультизадачное обучение и, по их словам, повышает его эффективность и гибкость
- Численных результатов и деталей экспериментальной методики в тексте не приведено
Почему это важно
Конфликты между задачами при обучении одной модели сразу на нескольких заданиях, известная практическая проблема: улучшение на одной задаче часто ухудшает результат на другой. Работа даёт этому явлению теоретическое объяснение на уровне интерференции градиентов и показывает принципиальную разницу между SFT и RL: у SFT интерференция растёт вместе с абсолютной величиной градиента, у RL она ограничена дисперсией, которая заведомо мала благодаря нормализации преимущества и on-policy оптимизации. Это объясняет, почему RL стабильнее переносится на мультизадачные сценарии, чем SFT.
Кому это важно
Работа адресована исследователям и инженерам, которые занимаются дообучением больших языковых моделей сразу на нескольких задачах, например, командам, совмещающим в одной модели разные типы рассуждений или инструкций. Полезна и тем, кто выбирает между SFT и RL как этапом посттренинга (post-training) для LLM.
Как это применить
Авторы предлагают конкретный практический выход из найденной проблемы, парадигму Parallel-RL, которая декаплирует (разделяет) обучение на разные задачи, опираясь на то, что RL-обновления для разных задач почти не пересекаются по направлению. По утверждению авторов, это значительно повышает эффективность и гибкость мультизадачного обучения. Численных показателей выигрыша, деталей архитектуры или кода в тексте не приведено, поэтому оценить масштаб эффекта на практике по одному описанию нельзя.
Можно ли доверять
Текст, абстракт научной статьи с теоретическим анализом (интерференция градиентов) и предварительными экспериментами, которые авторы описывают как собственное наблюдение. В тексте нет ни численных результатов, ни описания экспериментальной методики, датасетов или задач, ни состава авторов, это изложение идеи и вывода без данных, по которым независимо проверить масштаб эффекта.
Риски и подводные камни
Заявленное «значительное повышение эффективности и гибкости» Parallel-RL не подкреплено в тексте ни одной цифрой сравнения, судить о масштабе эффекта можно будет только после публикации самой статьи с экспериментальными данными. Также неясно, насколько выводы, полученные для конкретного набора задач в предварительных экспериментах авторов, переносятся на другие виды мультизадачного обучения.