SpyRL научил ИИ проверять качество открытых задач через игру в шпиона

SpyRL научил ИИ проверять качество открытых задач через игру в шпиона

Обучение с подкреплением на проверяемых наградах (Reinforcement Learning with Verifiable Rewards, RLVR) в последние годы стало главным способом улучшать рассуждающие большие языковые модели: правильность ответа можно строго и автоматически проверить, и это позволяет обучать модель в больших масштабах. Но у подхода есть жёсткое ограничение, он применим только там, где ответ можно детерминированно проверить, то есть почти исключительно в математике и программировании. Для открытых задач без единственно верного ответа, суммаризации текста, творческого письма и подобных, приходится опираться на человеческие предпочтения, отдельные модели-оценщики (reward models) или оценку самой LLM в роли судьи. Это вносит предвзятость оценки, упирается в потолок возможностей модели-судьи и добавляет затраты на дополнительный инференс.

Группа исследователей, первый автор публикации Цинси Ван (Qinsi Wang) с соавторами, предложила Reinforcement Learning with Self-Verifiable Rewards (RLSVR), парадигму обучения, которая переносит принцип проверяемых наград на открытые задачи за счёт трансформации самой задачи. Идея опирается на принцип самообучения (self-supervised learning): вместо поиска внешнего судьи RLSVR превращает открытую задачу в проверяемую «прокси-среду», чьи внутренние правила и итог взаимодействия агентов сами порождают сигнал награды, без участия человека или отдельной модели-оценщика.

Конкретной реализацией RLSVR стала SpyRL, многоагентная среда самообучения, построенная по мотивам известной игры «Кто шпион» (по типу «Мафии»). Несколько ИИ-агентов получают асимметричную информацию, выполняют одну и ту же целевую задачу (например, отвечают на вопрос или пишут текст), а затем голосованием пытаются определить среди себя «шпиона», агента с иной вводной. Поскольку личность «шпиона» заранее задана системе, результат голосования, это полностью проверяемая награда, не требующая ручной оценки или отдельного судьи. При этом успех агентов в разоблачении «шпиона» тесно связан с качеством их ответов на исходную задачу, так игровой механизм сам становится измерителем качества.

В экспериментах на суммаризации текста, творческом письме и математических рассуждениях SpyRL превзошёл существующие методы самоулучшения на неверифицируемых (открытых) задачах и дал стабильный прирост качества и на верифицируемых математических задачах. Авторы заключают, что трансформация задачи позволяет распространить масштабируемое RLVR-подобное самообучение за пределы изначально проверяемых областей. Конкретных числовых показателей прироста, баллов, процентов, разницы с базовыми методами, в тексте не приводится, как и данных о размере моделей, вычислительных затратах на обучение или лицензии. Модели и код SpyRL авторы выложили в открытый доступ на GitHub.

Ключевые факты

  • RLVR ограничен математикой и программированием, где ответ проверяется детерминированно; для открытых задач раньше нужны были люди-оценщики, reward models или LLM-судьи, с их предвзятостью, потолком качества и лишними расходами на инференс
  • RLSVR превращает открытую задачу в проверяемую «прокси-среду»: правила среды сами генерируют награду, без внешнего судьи или человека
  • Реализация RLSVR, SpyRL, многоагентная игра по мотивам «Кто шпион»: агенты выполняют задачу с разной вводной информацией и голосованием ищут «шпиона»; итог голосования даёт проверяемую награду, связанную с качеством ответов
  • На суммаризации текста, творческом письме и математике SpyRL обошёл существующие методы самоулучшения на открытых задачах и дал стабильный прирост и на проверяемых математических задачах, конкретных цифр авторы не привели
  • Модели и код SpyRL выложены в открытый доступ на GitHub (репозиторий wangqinsi1/SpyRL)

Почему это важно

RLVR дал резкий скачок качества рассуждающих моделей именно потому, что награду можно проверить автоматически и без человека, это и позволило масштабировать обучение. Но метод годился только для задач с формально верным ответом. Всё остальное, письмо, суммаризация, диалог, по-прежнему требовало людей-оценщиков или моделей-судей, а значит упиралось в их предвзятость, стоимость и ограниченную пропускную способность. RLSVR предлагает выход: не искать более точного судью, а переформулировать саму задачу так, чтобы она стала проверяемой по конструкции. Если подход обобщается, это снимает главное ограничение RLVR-подобного самообучения, применимость только к математике и коду.

Кому это важно

Исследовательским командам и лабораториям, которые обучают модели для открытых задач, письма, суммаризации, диалога, и хотят снизить зависимость от дорогих reward models или LLM-судей. Разработчикам методов самообучения и self-play, ищущим способы получать надёжный сигнал награды без разметки человеком. Инженерам, которые оценивают, во что превращается обучение с подкреплением после RLVR, какие следующие домены оно охватит.

Как это применить

Авторы выложили модели и код SpyRL в открытый доступ на GitHub, так что реализацию можно изучить и воспроизвести напрямую. Общая идея переносима на другие задачи: чтобы применить принцип RLSVR к своей открытой задаче, нужно придумать аналогичную «прокси-игру», механизм, где агенты решают целевую задачу с асимметричной информацией, а итог их взаимодействия (голосование, угадывание, сопоставление) объективно проверяем и коррелирует с качеством решения исходной задачи. В тексте не указаны требования к вычислительным ресурсам или лицензии, поэтому оценить трудозатраты на внедрение заранее нельзя.

Можно ли доверять

Источник, препринт исследователей, изложенный от первого лица авторов; независимых проверок, рецензирования или сторонних воспроизведений в тексте не упомянуто. Все выводы о превосходстве SpyRL, это заявления самих авторов, без опубликованных конкретных числовых показателей (баллов, процентов, доверительных интервалов), что не позволяет оценить масштаб улучшения. Авторы прямо называют три тестовых домена (суммаризация, творческое письмо, математика) и указывают, что код и модели открыты, это повышает проверяемость, но фактическая независимая верификация результатов пока не описана.

Риски и подводные камни

Главный открытый вопрос, насколько метод трансформации задачи в «прокси-игру» переносится за пределы трёх протестированных доменов: для многих открытых задач сложно придумать механизм с такими же гарантиями проверяемости. Есть и риск «игры в систему»: агенты могут научиться побеждать в голосовании способом, слабо связанным с реальным качеством ответа на исходную задачу, если механизм плохо откалиброван. Наконец, отсутствие числовых результатов в тексте не позволяет судить, насколько велик прирост качества и сопоставим ли он с обучением напрямую через RLVR там, где оно применимо.