Учёные объяснили, почему RL-обучение сильнее SFT в математических задачах

Известно, что модели рассуждений, обученные методом обучения с подкреплением (RL), решают математические задачи лучше моделей, прошедших только контролируемую тонкую настройку (SFT). Авторы работы задались вопросом, за счёт чего именно возникает это преимущество, и нашли два независимых подтверждения.

Первое: исследователи обучили линейные пробы (простые классификаторы) на скрытых состояниях модели по слоям, чтобы проверить, можно ли по этим представлениям предсказать, правильный ли ответ выдала модель. У RL-моделей такие пробы показывают более высокую точность, чем у SFT-моделей, это означает, что внутренние представления RL-моделей более линейно разделимы и структурированы: понятие «правильный ответ» в них выражено чётче.

Второе: эксперименты с усреднённой абляцией (искусственным «отключением» отдельных слоёв через замену их активаций на средние значения) показали разницу в архитектуре важности. У RL-моделей формируется иерархия, чем глубже слой, тем он критичнее для итогового результата. У SFT-моделей значимость распределена по слоям более равномерно, без выраженной иерархии.

Авторы также проанализировали, насколько стабильна длина ответа (число токенов) модели при многократной генерации решения одной и той же задачи, это показатель того, насколько адаптивно модель распределяет вычисления. Здесь картина неоднозначная: у части RL-моделей разброс длины ответов выше, чем у SFT-аналогов, а у других моделей, наоборот, наблюдается высокая стабильность. Из этого исследователи делают вывод, что вариативность распределения токенов зависит скорее от конкретного пайплайна обучения в целом, чем просто от выбора между RL и SFT. По мнению авторов, эта вариативность указывает на разброс правдоподобных вариантов рассуждения «по политике» (on-policy), то есть позволяет отличить модели со стабильной, предсказуемой стратегией решения от моделей с недоопределённым, потенциально неоднозначным поведением при решении одной и той же задачи.

Ключевые факты

  • RL-модели показывают более высокую точность предсказания правильности ответа по линейным пробам на скрытых состояниях, чем SFT-модели, то есть их внутренние представления более структурированы
  • У RL-моделей эксперименты с абляцией слоёв выявили иерархию: чем глубже слой, тем он важнее для ответа
  • У SFT-моделей важность слоёв распределена равномерно, без выраженной иерархии
  • Разброс длины ответов при повторной генерации решений у одних RL-моделей выше, чем у SFT-аналогов, а у других, сопоставим, то есть вариативность зависит от пайплайна обучения, а не только от типа обучения
  • Авторы делают вывод, что RL-обучение принципиально перестраивает способ, которым модель представляет и обрабатывает задачи рассуждения

Почему это важно

Работа отвечает на давно открытый вопрос: почему RL-обучение стабильно даёт моделям рассуждений преимущество над обычной тонкой настройкой в математических задачах. До этой работы разница фиксировалась только по итоговой точности ответов; авторы впервые показывают, что за ней стоит измеримая разница во внутреннем устройстве модели, в структуре представлений по слоям и в том, какие слои несут основную вычислительную нагрузку.

Кому это важно

Прежде всего исследователям, которые занимаются интерпретируемостью языковых моделей и разработкой методов обучения рассуждению: результат даёт конкретные измеримые критерии (точность линейных проб, иерархия важности слоёв), по которым можно сравнивать разные схемы обучения ещё до дорогих замеров на бенчмарках. Полезно и командам, которые выбирают между RL и SFT при обучении собственных моделей на задачи вывода и рассуждения.

Как это применить

Методику можно использовать как диагностический инструмент: обучив линейные пробы на скрытых состояниях модели по слоям и посмотрев на структуру важности слоёв через абляцию, можно оценить, насколько «зрело» модель научилась рассуждать, не дожидаясь дорогой оценки на полном наборе задач. Анализ вариативности длины ответов при повторной генерации также можно использовать как сигнал устойчивости стратегии модели, сильный разброс может говорить о недоопределённом, нестабильном способе решения задачи.

Можно ли доверять

Выводы опираются на два независимых и методологически разных эксперимента (линейные пробы и абляция слоёв), которые указывают в одну сторону, что повышает надёжность результата. При этом авторы честно отмечают неоднозначность в третьей части анализа, по вариативности числа токенов результаты у разных моделей расходятся, и однозначного вывода «RL всегда даёт больший разброс» они не делают.

Риски и подводные камни

Из текста не следует, на каком именно наборе моделей и задач проводились эксперименты, поэтому неясно, насколько выводы обобщаются за пределы использованных моделей и математических задач. Часть результата (по вариативности числа токенов) сами авторы называют неоднозначной и зависящей от конкретного пайплайна обучения, а не только от выбора RL или SFT, это ограничивает практическую применимость этого конкретного вывода.