DiagEvo: языковые модели учатся на памяти своих ошибок без внешних данных

Self-play, обучение модели через её собственную игру сама с собой, одна из рабочих схем самоулучшения языковых моделей: решатель генерирует и решает задачи, а прогресс идёт по итогам раундов. Проблема в том, что без направляющего сигнала точность решателя со временем выходит на плато или падает. Существующие «ненаправленные» методы подбирают задачи по сложности, обучаемости или разнообразию, это держит вопросы интересными, но не указывает, какие именно слабые места в рассуждениях нужно закрывать в следующем раунде. «Направленные» методы решают эту проблему, но берут ориентир извне: человеческие примеры, текстовые корпуса или заранее заданные уровни сложности, то есть зависят от ресурсов вне самого цикла self-play.
Авторы показывают, что нужное направление можно получить не извне, а из истории провалов самого решателя. В DiagEvo этим занимается модуль-диагностик: он выявляет повторяющиеся причины ошибок и складывает их в иерархическую память. Память группирует связанные причины ошибок в узлы навыков и помечает каждый узел как «активный» или «освоенный», на основе самосогласованности ответов решателя на вопросы, нацеленные на этот навык (то есть по тому, насколько по-разному модель отвечает на похожие вопросы). Модуль-генератор задач использует эти метки и число повторов каждой ошибки, чтобы балансировать между вопросами, целенаправленно бьющими по слабым местам, и вопросами для свободного исследования. Отдельный фильтр, «фильтрация по двойной уверенности», оставляет в учебной программе только вопросы средней сложности: те, где самый частый ответ решателя набрал явный перевес голосов среди его собственных попыток. В итоге DiagEvo строит программу обучения целиком из информации, порождённой в ходе self-play, без каких-либо внешних задачных ресурсов.
Метод проверили на трёх решателях, Qwen3-4B, Qwen3-8B и OctoThinker-8B, с диагностиком по умолчанию на 4 млрд параметров. DiagEvo обошёл все базовые методы по средней точности на всех девяти тестовых бенчмарках для каждого из трёх решателей. На Qwen3-8B средняя точность по пяти математическим бенчмаркам составила 72,3%, на 4,5 процентных пункта выше результата метода R-Zero. По всем девяти бенчмаркам средняя точность DiagEvo, 57,4%, на 1,1 процентного пункта выше метода DARC. Абляционные эксперименты (проверка вклада отдельных частей метода) показывают, что рост точности дают обе компоненты одновременно: и иерархическая память причин ошибок, и фильтрация по двойной уверенности.
Ключевые факты
- DiagEvo, метод самообучения языковых моделей по схеме self-play, который строит учебную программу без внешних данных: без человеческих примеров, текстовых корпусов или заданных уровней сложности
- Диагностик извлекает повторяющиеся причины ошибок решателя из истории провалов и хранит их в иерархической памяти: узлы навыков помечаются «активными» или «освоенными» по самосогласованности ответов на целевые вопросы
- Генератор задач опирается на эти метки и число повторов ошибок, балансируя между вопросами по слабым местам и свободным исследованием; фильтрация по двойной уверенности оставляет только вопросы средней сложности с явным перевесом голосов за самый частый ответ решателя
- Метод протестирован на трёх решателях, Qwen3-4B, Qwen3-8B и OctoThinker-8B, и с диагностиком по умолчанию на 4 млрд параметров превзошёл все базовые методы по средней точности на всех девяти бенчмарках
- На Qwen3-8B DiagEvo даёт 72,3% средней точности по пяти математическим бенчмаркам (на 4,5 п.п. выше R-Zero) и 57,4% по всем девяти бенчмаркам (на 1,1 п.п. выше DARC); абляции показывают вклад и иерархической памяти, и фильтрации по двойной уверенности
Почему это важно
Self-play, один из главных путей улучшать рассуждения языковых моделей без новой размеченной человеком выборки, но у него известная слабость: без направляющего сигнала точность решателя со временем перестаёт расти или проседает. До сих пор направленность бралась либо из простых сигналов вроде сложности и разнообразия вопросов (без прицела на конкретные слабости), либо из внешних ресурсов, человеческих примеров и готовых корпусов. DiagEvo показывает, что направление можно получить прямо из истории ошибок самого решателя, не привлекая ничего снаружи цикла self-play.
Кому это важно
Работа адресована исследователям и инженерам, которые строят пайплайны самоулучшения языковых моделей через self-play или похожие схемы reinforcement learning, и в первую очередь тем, у кого нет доступа к большим размеченным датасетам или подготовленным человеком примерам для построения учебной программы. Также интересна командам, которые оценивают модели на математических и смежных бенчмарках рассуждений и ищут способ поднять точность без сбора новых данных.
Как это применить
DiagEvo, не готовый продукт с ценой, а метод обучения из трёх частей: диагностик, который вычленяет повторяющиеся причины ошибок решателя и складывает их в иерархическую память с узлами навыков (статусы «активный»/«освоенный»); генератор задач, который по этим статусам и частоте повторов ошибок решает, какие вопросы предложить решателю дальше; и фильтр по двойной уверенности, отсекающий слишком лёгкие и слишком спорные вопросы и оставляющий вопросы средней сложности. На практике это встраивается в цикл self-play-обучения как замена внешним источникам сложности вопросов, источником становится сама история попыток решателя.
Можно ли доверять
Материал, это описание метода со страницы Hugging Face Papers, текст полный и содержит конкретные числа и сравнение с несколькими базовыми методами (R-Zero, DARC) на девяти бенчмарках и трёх разных решателях, плюс отдельные абляционные эксперименты, проверяющие вклад каждой части метода. В доступном тексте нет имён авторов, их места работы и даты публикации, независимо сверить эти данные или статус рецензирования по одному этому тексту нельзя.
Риски и подводные камни
Ключевое допущение метода, что самосогласованность ответов решателя (насколько по-разному он отвечает на похожие вопросы) надёжно показывает, освоен навык или нет; это самооценка модели, а не независимая проверка правильности, и она может ошибаться там, где решатель уверенно и стабильно ошибается. Результаты приведены на конкретном наборе из девяти бенчмарков и трёх решателей (Qwen3-4B, Qwen3-8B, OctoThinker-8B), перенос выигрыша на другие модели и задачи в тексте не подтверждён. Данных об авторах и институциональной принадлежности работы в тексте нет, что затрудняет независимую проверку контекста публикации.