PaperGym научил модели Qwen3 планировать научные эксперименты

Планирование исследования, ключевая способность для систем, которые должны сами вести научную работу. Проблема в том, что у исследовательского плана нет проверяемого правильного ответа, поэтому обучению с подкреплением не на чем строить среду с критиком. Рубрики (наборы критериев оценки), извлечённые из научных статей, могли бы служить таким критиком, но в существующих пайплайнах вопрос задания и критерии оценки берутся из одного и того же куска текста статьи, из-за этого модель может получать награду просто за перефразирование, а сама рубрика при этом сжимается в одно число на попытку.
PaperGym решает эту проблему за счёт структуры статьи: вопрос задания синтезируется из цели исследования и предыстории (introduction/background), а критерии оценки, отдельно из раздела метода и экспериментов. Критерии охватывают методологическую новизну и качество экспериментального дизайна. За счёт разделения источников утечка критериев в вопрос падает до 3,7% против 11,90, 34,10% у существующих наборов данных.
Обучение использует рубрику дважды: сначала как привилегированный контекст для само-обучающегося модуля OPSD, затем как награду для алгоритма обучения с подкреплением GRPO. На моделях Qwen3-1.7B/4B/8B такая последовательность (сначала OPSD, потом GRPO) превзошла и обычное дообучение с учителем (SFT), и каждый из этапов по отдельности, и обратный порядок этапов, средний результат по пяти бенчмаркам вырос на +5,6, +5,0 и +4,8 балла соответственно для моделей 1,7B, 4B и 8B.
При фиксированном остальном рецепте обучения модели, обученные на датасете PaperGym-20k, выигрывают 58,1% попарных (точнее, трёхсторонних) сравнений против 28,2% у моделей на наборе RubricHub Science. Обученная модель Qwen3-8B набирает 73,48 балла на бенчмарке ResearchQA, выше результата значительно более крупной модели Kimi K2.6 (собственный балл Kimi K2.6 в статье не приводится, указано только, что PaperGym-модель её опережает).
Авторы выкладывают в открытый доступ пайплайн генерации, датасет из 20 000 примеров PaperGym-20k и два бенчмарка, PaperGym-Innov и PaperGym-Design.
Ключевые факты
- PaperGym превращает научную статью в тренировочную среду для обучения с подкреплением: вопрос задания и критерии оценки берутся из разных частей статьи, чтобы модель не могла получить награду перефразированием
- Утечка критериев в вопрос падает до 3,7% против 11,90, 34,10% у существующих датасетов
- Схема обучения «сначала OPSD, потом GRPO» подняла средний результат моделей Qwen3-1.7B/4B/8B по пяти бенчмаркам на +5,6/+5,0/+4,8 балла соответственно
- Модели, обученные на PaperGym-20k, выигрывают 58,1% сравнений против 28,2% у RubricHub Science
- Qwen3-8B набирает 73,48 на ResearchQA, выше значительно более крупной Kimi K2.6; в открытый доступ выложены пайплайн, датасет PaperGym-20k и бенчмарки PaperGym-Innov и PaperGym-Design
Почему это важно
Планирование исследования, то, без чего системы-«ИИ-учёные» не могут работать самостоятельно, но до сих пор не было надёжного способа обучать и проверять качество такого плана: у него нет единственного проверяемого ответа, а значит нет и среды для обучения с подкреплением. Прежние попытки строить критерии оценки прямо из того же текста, что и задание, позволяли моделям обманывать проверку перефразированием. PaperGym закрывает именно этот пробел, разделяя источники вопроса и критериев.
Кому это важно
Команды, которые обучают или оценивают ИИ-агентов для автоматизации научной работы, а также инженеры, занимающиеся дизайном наград и сред для обучения с подкреплением языковых моделей, им PaperGym даёт готовый рецепт и датасет для похожей задачи.
Как это применить
Авторы выложили в открытый доступ весь пайплайн генерации сред, датасет из 20 000 примеров PaperGym-20k и два бенчмарка, PaperGym-Innov и PaperGym-Design. Их можно использовать напрямую для обучения собственных моделей планированию исследований по схеме «сначала рубрика как контекст для самообучения OPSD, затем рубрика как награда для GRPO», именно эта последовательность дала наибольший прирост в статье.
Можно ли доверять
Цифры, это результаты, которые сообщают сами авторы работы; независимого воспроизведения или рецензирования в тексте не упомянуто. В материале нет имён авторов и указания на организацию, нет даты публикации, а аббревиатуры OPSD и GRPO нигде не расшифровываются, поэтому детали метода остаются частично непрозрачными. Собственный балл Kimi K2.6 на ResearchQA в тексте тоже не назван, известно только, что модель на PaperGym её обошла.
Риски и подводные камни
Оба новых бенчмарка (PaperGym-Innov и PaperGym-Design), на которых демонстрируется превосходство подхода, созданы теми же авторами, что и сам метод, независимой проверки на внешних тестах пока нет. Сравнение с Kimi K2.6 сформулировано как «выше», без конкретного числа соперника, что не позволяет оценить разрыв. Метод завязан на конкретную структуру научной статьи (явно выделенные цель, предыстория, метод и эксперименты), на текстах с другой структурой разделение вопроса и критериев может работать хуже.