R-Quest не даёт самообучающимся моделям рассуждений деградировать

Самообучающиеся модели рассуждений учатся на вопросах, которые сами же и генерируют, но повторное самообучение может приводить к обвалу качества. Авторы статьи выясняют, почему результаты ухудшаются от раунда к раунду и как сделать самоэволюцию устойчивой.
Анализ выявляет две повторяющиеся проблемы в сгенерированных вопросах: некорректные вопросы и повторяющиеся варианты одних и тех же математических вопросов. Во-первых, доля некорректных вопросов растёт с каждым раундом, а фильтрация по согласованности ответов ещё больше увеличивает их долю в обучающих данных. Во-вторых, существующие способы контроля разнообразия вопросов, основанные на лексическом сходстве, могут пропускать математически эквивалентные вопросы, сформулированные по-разному. Из-за этого в поздних раундах разнообразие вопросов схлопывается.
На этих наблюдениях построен метод R-Quest, который использует обратную связь о корректности и новизне вопросов. Сначала «решатель» (solver) обучается распознавать и отклонять некорректные вопросы; его оценки затем направляют награды «вопрошающего» (questioner) и фильтруют обучающие данные самого решателя. Чтобы избежать повторов, замороженная базовая модель сравнивает пары выбранных вопросов и выдаёт обратную связь о новизне.
По результатам экспериментов, метод стабильно показывает наивысшую среднюю производительность на 12 бенчмарках по математическим рассуждениям, рассуждениям общего профиля и генерации кода на двух семействах моделей. Кроме того, R-Quest сохраняет устойчивый прирост на протяжении десяти раундов самоэволюции, достигая пика в последнем раунде и опережая R-Zero на 17,32 пункта.
Ключевые факты
- Повторное самообучение моделей рассуждений на собственных вопросах может приводить к обвалу качества; авторы ищут причины и способ его избежать.
- Выявлены две проблемы: доля некорректных вопросов растёт от раунда к раунду (фильтрация по согласованности ответов усугубляет это), а контроль разнообразия по лексическому сходству пропускает математически эквивалентные вопросы.
- R-Quest обучает решателя отклонять некорректные вопросы, использует его оценки для наград вопрошающего и фильтрации данных, а замороженная базовая модель сравнивает пары вопросов и оценивает новизну.
- Наивысшая средняя производительность на 12 бенчмарках (математика, рассуждения общего профиля, код) на двух семействах моделей.
- Устойчивый прирост за десять раундов самоэволюции; в последнем раунде R-Quest опережает R-Zero на 17,32 пункта.
Почему это важно
Самообучение модели на собственных вопросах позволяет обходиться без размеченных людьми данных, но, как показывает статья, быстро упирается в деградацию. Работа указывает конкретные причины: накопление некорректных вопросов и схлопывание разнообразия, которое не ловится сравнением формулировок по лексике. Понимание причин даёт возможность лечить их напрямую, а не просто останавливать обучение.
Кому это важно
Исследователям, которые работают над самоэволюцией и обучением с подкреплением для моделей рассуждений и опираются на R-Zero как на базовый подход. Также тем, кто строит конвейеры синтетических данных: наблюдение о том, что фильтрация по согласованности ответов повышает долю некорректных вопросов, касается любой схемы с самогенерацией задач.
Как это применить
Идеи метода переносимы на уровне схемы: обучить решателя отклонять некорректные вопросы и использовать его оценки и для наград генератора вопросов, и для фильтрации обучающих данных; для борьбы с повторами сравнивать пары вопросов замороженной базовой моделью, а не по лексическому сходству. Выпуск кода, данных или моделей в тексте источника не упоминается.
Можно ли доверять
Это описание научной статьи, все заявленные результаты исходят от самих авторов. В тексте нет названий бенчмарков и моделей двух семейств, не указано, по какой метрике получены 17,32 пункта преимущества над R-Zero, поэтому масштаб эффекта нельзя оценить независимо. Нужна проверка полного текста статьи и воспроизведение результатов.
Риски и подводные камни
Прирост в 17,32 пункта относится к последнему раунду из десяти и к сравнению с R-Zero; без указания метрики его не стоит трактовать как общее превосходство. Метод добавляет дополнительные компоненты (обучение решателя распознавать некорректные вопросы, отдельная замороженная модель для оценки новизны), то есть усложняет конвейер обучения. Устойчивость показана на десяти раундах и двух семействах моделей; за этими пределами она не подтверждена.