Mixed SFT обошёл RL-метод рассуждений, дешевле более чем в 60 раз

Данные без явных цепочек рассуждений (no-CoT), например, разобранные решения задач и выводы формул из учебников, содержат богатый материал для обучения модели рассуждать, но не размечены пошаговыми объяснениями (chain-of-thought, CoT). Чтобы извлечь из них пользу, в недавних работах предложен метод next-chunk reasoning RL: модель обучают генерировать собственные неявные шаги рассуждений, а вознаграждают за то, насколько эти шаги помогают ей верно предсказать следующий фрагмент текста. Проблема в том, что этот метод до сих пор сравнивали в основном с обычным SFT-дообучением (supervised fine-tuning, дообучение с учителем), поэтому оставалось неясно, даёт ли выигрыш сама конструкция RL или дело просто в том, что модель эффективнее знакомится с no-CoT данными.
Авторы новой работы поставили контролируемое сравнение next-chunk reasoning RL с более простой и ранее не рассмотренной альтернативой, Mixed SFT: единым этапом SFT, на котором модель обучается сразу на no-CoT данных и на данных, где цепочка рассуждений уже расписана явно (long-CoT), а не на них по отдельности.
Несмотря на простоту, Mixed SFT дал заметно более высокий потолок качества после этапа RLVR (обучение с подкреплением на проверяемых наградах, reinforcement learning with verifiable rewards) по сравнению с next-chunk reasoning RL, и потребовал при этом более чем в 60 раз меньше вычислительных затрат на обучение. Преимущество оказалось устойчивым: оно сохранилось и на задачах математических рассуждений, которые совпадают с областью обучающих данных (in-domain), и на задачах рассуждений вне этой области (out-of-domain).
Отдельно авторы показали, что более высокая точность модели до этапа RLVR не гарантирует более высокую точность после него: ранжирование методов по промежуточному чекпоинту может не совпадать с их итоговым качеством. Вывод авторов, стратегии обучения на no-CoT данных нужно сравнивать по результату всего пайплайна дообучения, включая RLVR-этап, а не по точности сразу после SFT-стадии. Работа опубликована на arXiv 24 августа 2026 года как препринт, ещё не прошедший независимое рецензирование; текст не называет ни конкретный бенчмарк или датасет, ни базовую модель эксперимента, и не приводит абсолютных цифр точности, только относительную экономию вычислений и качественное сравнение «потолков» качества.
Ключевые факты
- Контролируемое исследование сравнило RL-метод next-chunk reasoning RL (обучает модель генерировать неявные шаги рассуждений и вознаграждает её за точность предсказания следующего фрагмента текста на данных без явных цепочек рассуждений, no-CoT) с более простой альтернативой, Mixed SFT.
- Mixed SFT, единый этап SFT-дообучения, где no-CoT данные (разобранные решения задач, выводы формул из учебников) используются совместно с данными, где цепочка рассуждений уже расписана явно (long-CoT), а не по отдельности.
- Несмотря на простоту, Mixed SFT дал более высокий потолок качества после RLVR-этапа, чем next-chunk reasoning RL, и потребовал более чем в 60 раз меньше вычислительных затрат на обучение.
- Преимущество Mixed SFT сохранилось и на задачах внутри тренировочного домена (математические рассуждения), и на задачах вне его, то есть не ограничено одной областью.
- Более высокая точность модели до RLVR-этапа не гарантирует более высокую точность после него, авторы делают вывод, что стратегии обучения на no-CoT данных нужно оценивать по итогам всего пайплайна дообучения, а не по промежуточному чекпоинту.
Почему это важно
В последний год многие команды достраивают reasoning-модели RL-этапом поверх обычного дообучения, в расчёте, что подкрепление раскрывает то, что SFT будто бы упускает. Эта работа проверяет именно эту логику на конкретном случае: метод next-chunk reasoning RL, придуманный, чтобы извлечь пользу из данных без явных цепочек рассуждений, разобранных решений задач и выводов формул из учебников, до сих пор сравнивали в основном с обычным SFT-дообучением, поэтому оставалось неясно, даёт ли выигрыш сама конструкция RL или просто более удачный способ показать модели те же данные. Контролируемое сравнение показывает: дело не в RL как таковом, простой единый этап SFT, где no-CoT и long-CoT данные используются вместе (Mixed SFT), даёт более высокий потолок качества после RLVR-этапа при вычислениях более чем в 60 раз меньше. Это прямой аргумент против практики решать задачу усложнением RL-обвязки там, где хватает более простого и дешёвого дообучения.
Кому это важно
В первую очередь, командам, которые строят пайплайн дообучения reasoning-моделей и решают, куда девать большие массивы данных без готовой разметки цепочек рассуждений: разобранные решения, конспекты, выводы формул из учебников. Это касается и тех, кто уже использует или рассматривает next-chunk reasoning RL как способ извлечь пользу из такого материала, результат прямо ставит под сомнение оправданность этого выбора по сравнению с более дешёвой альтернативой. Отдельно это важно для тех, кто оценивает подобные стратегии обучения по метрикам сразу после SFT-этапа: авторы показывают, что такая оценка может вводить в заблуждение относительно итогового результата после RLVR.
Как это применить
Практический вывод для тех, кто проектирует пайплайн дообучения reasoning-модели: вместо отдельного RL-этапа с наградой за предсказание следующего фрагмента текста для данных без цепочек рассуждений можно объединить эти данные с данными, где цепочка рассуждений уже расписана явно (long-CoT), в одном обычном SFT-этапе, это и есть Mixed SFT. По данным исследования, такой подход даёт более высокий потолок качества после RLVR и обходится более чем в 60 раз дешевле по вычислениям, причём преимущество не привязано к одной узкой области, оно сохраняется и на задачах вне тренировочного домена. Второй практический вывод, методологический: если сравниваются стратегии работы с no-CoT данными, точность сразу после SFT-этапа (до RLVR), ненадёжный ориентир; сравнивать нужно по результату после полного пайплайна, включая RLVR-этап, иначе можно выбрать метод, который выглядит лучше на промежуточном шаге, но проигрывает в итоге.
Можно ли доверять
Это контролируемое сравнение, поставленное специально, чтобы отделить эффект самой конструкции RL от эффекта более удачного использования данных, методологически сильнее, чем сравнение с посторонним SFT-бейзлайном, на которое опирались более ранние работы. При этом текст статьи не называет ни конкретный бенчмарк, ни датасет, ни базовую модель эксперимента (её название или размер), не приводит абсолютных цифр точности ни для одного из двух методов, только относительную экономию вычислений (более чем в 60 раз) и качественное утверждение о «более высоком потолке» качества, без кода, датасета или весов модели в открытом доступе. Работа опубликована на arXiv 24 августа 2026 года как препринт, то есть ещё не прошла независимое рецензирование, и цифры или формулировки в финальной версии могут измениться.
Риски и подводные камни
Это сравнение, про способ использования no-CoT данных, а не про отказ от RL-обучения как такового: в обеих сравниваемых схемах после SFT-этапа всё равно идёт RLVR, и «потолок качества» измеряется именно после него. Обобщать вывод до «RL для reasoning-моделей не нужен» ошибочно, статья говорит конкретнее: для no-CoT данных не нужен именно next-chunk reasoning RL, если есть Mixed SFT. Кроме того, источник не называет ни модель, ни бенчмарк, ни объём данных эксперимента, поэтому неясно, сохранится ли разрыв более чем в 60 раз на других масштабах и архитектурах, вывод пока проверен в рамках одной, подробно не описанной постановки эксперимента. Наконец, это неотрецензированный препринт, и его итоговые формулировки могут измениться при рецензировании.