Reflective Recovery: новый метод учит модели ИИ исправлять свои ошибки в рассуждении
Дообучение на готовых примерах (imitation learning), стандартный способ улучшить способность языковых моделей рассуждать: он прост и эффективен. Но у него есть предел: если использовать только безупречные цепочки рассуждений, а набор задач ограничен, то добавление новых правильных примеров перестаёт давать прирост качества, авторы называют это эффектом Scaling Collapse. Есть и вторая проблема: во время вывода модель не может гарантировать правильность каждого промежуточного шага, поэтому ошибается. Если ошибка возникла, модель обычно не может из неё выбраться и дальше сбивается всё сильнее из-за накопления предыдущих промахов. Чтобы решить обе проблемы разом, авторы предлагают Reflective Recovery, простой самообучаемый (self-supervised) метод, который превращает неудачные попытки рассуждения в обучающие данные для восстановления. Работает это так: из проваленной цепочки рассуждений берут только начальный фрагмент, приклеивают его к исходному промпту и используют такую пару, чтобы довести модель до правильного решения. Поскольку эти фрагменты взяты из проваленных попыток, они, скорее всего, уже содержат ошибку, и модель учится замечать и исправлять её прямо по ходу рассуждения, восстанавливаясь из ошибочного состояния без привлечения внешних критиков или отдельных моделей вознаграждения. На обширных бенчмарках метод даёт заметный прирост: на модели DeepSeek-R1-Distill-Qwen-7B точность выросла с 30.0% до 37.5% на AIME 2025 и с 37.6% до 47.8% на Minerva. По утверждению авторов, анализ показывает, что метод преодолевает барьер Scaling Collapse и порождает у моделей эмерджентное поведение самокоррекции, то есть сдвиг от простого запоминания правильного ответа к рефлексивному рассуждению, ориентированному на сам процесс.
Ключевые факты
- Reflective Recovery превращает начальные фрагменты неудачных цепочек рассуждений модели в обучающие данные для восстановления после ошибки, без внешних критиков и моделей вознаграждения.
- На модели DeepSeek-R1-Distill-Qwen-7B точность выросла с 30.0% до 37.5% на бенчмарке AIME 2025.
- На бенчмарке Minerva точность на той же модели выросла с 37.6% до 47.8%.
- Метод, по заявлению авторов, преодолевает эффект Scaling Collapse, ситуацию, когда при ограниченном наборе задач рост числа правильных примеров дообучения перестаёт улучшать результат.
- Авторы фиксируют появление эмерджентного поведения самокоррекции, сдвиг от запоминания результата к рефлексивному рассуждению, ориентированному на процесс.
Почему это важно
Обычное дообучение reasoning-моделей на одних только правильных цепочках упирается в потолок: при небольшом наборе задач добавление новых верных примеров перестаёт улучшать модель. Вдобавок модель, ошибившись на одном шаге рассуждения, обычно не умеет из этой ошибки выбраться и продолжает сбиваться дальше. Reflective Recovery решает обе проблемы одним приёмом: учит модель на её же собственных провалах, показывая ей начало неудачной попытки и правильное продолжение.
Кому это важно
Тем, кто дообучает или использует reasoning-модели (модели с цепочками рассуждений), особенно когда доступных обучающих задач мало и обычное дообучение на правильных примерах уже не даёт роста. В статье метод проверен на модели DeepSeek-R1-Distill-Qwen-7B.
Как это применить
Метод не требует ни внешнего критика, ни отдельной модели вознаграждения, только собственные проваленные попытки рассуждения самой модели. Начальный фрагмент такой неудачной попытки приклеивается к исходному промпту и используется как обучающий пример, ведущий к верному решению. Поскольку это self-supervised подход без обучения с подкреплением и без разметки человеком, он потенциально дешевле в развёртывании, чем схемы с внешними критиками или моделями вознаграждения.
Можно ли доверять
Это препринт на arXiv; в тексте аннотации не названы ни авторы, ни организация, ни дата публикации. Результаты приведены только для одной модели (DeepSeek-R1-Distill-Qwen-7B) и двух конкретных бенчмарков, AIME 2025 и Minerva; упомянутые в тексте «обширные бенчмарки» за пределами этих двух в самом тексте не расписаны.
Риски и подводные камни
Заявленный эффект, снятие Scaling Collapse и появление самокоррекции, пока показан только на одной модели и двух бенчмарках, и неясно, насколько он воспроизводится на других архитектурах и задачах. Численного сравнения с подходами на внешних критиках или моделях вознаграждения, с которыми метод противопоставляется, в тексте не приведено, есть только утверждение, что Reflective Recovery обходится без них.