Исследование на шахматах показало: предобучение определяет пользу RL для ИИ-рассуждений

Исследование на шахматах показало: предобучение определяет пользу RL для ИИ-рассуждений

Обучение с подкреплением (RL) стало ключевым инструментом для развития у больших языковых моделей сложных навыков рассуждения, но обычно его изучают в отрыве от предшествующего предобучения. Из-за этого остаются открытыми два вопроса: как параметры предобучения (размер модели, объём данных) влияют на отдачу от RL, и что именно RL меняет в модели. Изучить это на обычных языковых моделях сложно: корпуса для предобучения огромны и плохо контролируются, поэтому трудно понять, что определило поведение модели, предобучение или RL, а систематический перебор вычислительных бюджетов на обоих этапах обходится слишком дорого.

Чтобы обойти эти ограничения, исследователи выбрали шахматы как контролируемый испытательный стенд для изучения рассуждений на всём пути от предобучения до RL-дообучения. Они повторили стандартный пайплайн обучения языковых моделей: предобучили модели размером от 5 миллионов до 1 миллиарда параметров на партиях людей, затем провели контролируемую тонкую настройку (SFT) на синтетических цепочках рассуждений, а после, обучение с подкреплением на шахматных задачах с проверяемыми наградами (правильность хода можно однозначно проверить).

Главный результат: итоговое качество модели после RL хорошо предсказывается по величине потерь (ошибки) модели на этапе предобучения, а скорость роста кривой вознаграждения при RL увеличивается почти линейно с объёмом токенов, использованных на предобучении. Иными словами, чем лучше и дольше модель предобучена, тем больше пользы даёт последующий RL, причём эту пользу можно оценить заранее.

Второе наблюдение касается того, что именно делает RL с уже настроенной (SFT) политикой модели. Оказалось, что RL не просто «затачивает» уже имеющиеся у модели предпочтения. На лёгких задачах RL усиливает верные ходы, которые модель после SFT уже была склонна выбирать. А вот на трудных задачах RL, наоборот, «вытаскивает» правильные ходы, которых после одного только SFT в ответах модели почти не было, то есть RL способен открывать новые верные решения, а не только повышать уверенность в уже найденных.

Чтобы проверить, что закономерность не специфична для шахмат, исследователи повторили эксперимент на математике: обучили модель с 1 миллиардом параметров на текстах математической тематики. Обнаружилась та же самая предсказуемая картина, модели с более длительным предобучением после RL показывают более высокий итоговый результат и быстрее растут в процессе самого RL.

Авторы делают вывод, что получили количественное описание того, как предобучение и RL-дообучение стыкуются друг с другом, а заодно, контролируемый испытательный стенд для дальнейшего изучения того, как именно у языковых моделей формируется способность к рассуждению на всём пути обучения.

Ключевые факты

  • Вместо неконтролируемых веб-корпусов исследователи взяли шахматы как контролируемый полигон и обучили модели от 5 млн до 1 млрд параметров.
  • Пайплайн повторяет стандартное обучение LLM: предобучение на партиях людей → SFT на синтетических цепочках рассуждений → RL на шахматных задачах с проверяемыми наградами.
  • Итоговое качество после RL хорошо предсказывается по потерям модели на предобучении; скорость роста вознаграждения при RL растёт почти линейно с объёмом предобучающих токенов.
  • RL не просто усиливает уже готовую политику SFT: на лёгких задачах он закрепляет уже освоенные верные ходы, а на трудных, открывает верные ходы, которых после SFT почти не было.
  • Проверка на математике (модель на 1 млрд параметров) подтвердила ту же закономерность: чем дольше предобучение, тем выше результат после RL и тем быстрее рост в ходе самого RL.

Почему это важно

RL-дообучение для рассуждений обычно изучают отдельно от предобучения, из-за чего непонятно, откуда берётся итоговый результат модели, из качества предобучения или из самого RL. Это исследование впервые в контролируемых условиях показывает, что эти два этапа связаны напрямую: качество предобучения количественно предсказывает, сколько пользы даст последующий RL, а не просто «помогает вообще».

Кому это важно

Исследователям и инженерам, которые разрабатывают рассуждающие модели и распределяют вычислительный бюджет между предобучением и RL-дообучением, а также всем, кто изучает, как у языковых моделей вообще формируется способность к рассуждению на разных этапах обучения.

Как это применить

Результат подсказывает практический ориентир: перед тем как вкладывать вычисления в RL-дообучение, можно оценить, насколько эффективно предобучена модель (по величине потерь и объёму токенов), это заранее укажет, сколько прироста даст RL. Это помогает решать, стоит ли сначала доинвестировать в предобучение или сразу переходить к RL.

Можно ли доверять

Работа построена на контролируемом эксперименте: шахматы дают чёткие, проверяемые правильные ответы, что снижает шум по сравнению с обычными задачами на естественном языке. Авторы дополнительно проверили закономерность на другом домене, математике, и получили тот же результат, что говорит в пользу общности вывода, а не случайного совпадения на одном наборе данных.

Риски и подводные камни

Эксперименты проведены на сравнительно небольших моделях (от 5 млн до 1 млрд параметров) и на задачах с чётко проверяемым правильным ответом, шахматных ходах и математике. Перенос выводов на полноразмерные языковые модели и на открытые, не всегда однозначно проверяемые задачи рассуждения на естественном языке пока не доказан и требует отдельной проверки.