SPADE: языковая модель сама придумывает себе тренировочные задачи и учится их решать

Исследователи представили SPADE (Self-Play in Adaptive Synthetic Executable Environments), фреймворк обучения с подкреплением, в котором одна языковая модель играет сразу две роли. Первая, «Дизайнер среды» (Environment Designer): модель сама пишет полноценные исполняемые тренировочные среды в виде кода, с интерфейсом reset()/step() в стиле OpenAI Gym, то есть создаёт долгие многошаговые задачи вместе с функциями вознаграждения и кодом проверки результата. Вторая роль, «Рассуждающий агент» (Reasoning Agent): та же модель учится действовать в этих средах и решать поставленные задачи. Один и тот же интерфейс охватывает и обычные рассудочные задачи, и многошаговое агентное использование инструментов.
Проблему, которую решает SPADE, авторы формулируют так: существующие пулы тренировочных сред для языковых агентов, размеченные вручную, статически сгенерированные или основанные на «замороженном» верификаторе, держат распределение целей фиксированным, даже когда сама обучаемая модель становится сильнее. У SPADE это устроено иначе: «сожаление» (regret) рассуждающего агента оценивается через разницу между наградой, которую он получает с привилегированными подсказками, и наградой без них; именно на минимизацию этого сигнала настраивается Дизайнер среды. В итоге он учится подбирать среды на грани возможностей агента, достаточно сложные, чтобы стимулировать рост, но всё ещё выполнимые.
Авторы называют два компонента, критичных для успеха подхода: Дизайнер среды должен опираться на документы, взятые из большого предобучающего корпуса, и ему нужна накапливаемая информация о уже созданных средах. На моделях масштаба 30 млрд параметров SPADE превзошёл сильнейший фиксированный (не самообучаемый) базовый вариант в среднем на 5,3 пункта по восьми отложенным бенчмаркам из области математики, науки, кода и рассуждений. В сценариях с использованием инструментов прирост составил 5,7 пункта на многоходовом бенчмарке BFCL-v4 и 13,9 пункта на ACEBench-Agent. В игровых сценариях преимущество SPADE над лучшим базовым вариантом росло по мере увеличения масштаба модели, конкретных цифр этого роста источник не приводит. Превращая само проектирование тренировочной среды в обучаемый компонент, SPADE, по словам авторов, делает конкретный шаг к открытому, не ограниченному заранее самоулучшению моделей.
Ключевые факты
- SPADE, self-play фреймворк обучения с подкреплением: одна языковая модель попеременно выступает «Дизайнером среды», который пишет исполняемый код тренировочных сред, и «Рассуждающим агентом», который в этих средах учится действовать.
- Каждая среда, код с интерфейсом reset()/step() в стиле OpenAI Gym: есть переходы между состояниями, функция вознаграждения и код проверки результата, подход охватывает и рассуждение, и многошаговое использование инструментов.
- Дизайнер среды настраивается на сигнал «сожаления» (regret) агента, разницу между наградой с привилегированными подсказками и без них, и учится подбирать задачи на грани возможностей агента, но всё ещё выполнимые.
- На моделях масштаба 30 млрд параметров SPADE обошёл лучший фиксированный вариант в среднем на 5,3 пункта по восьми отложенным бенчмаркам математики, науки, кода и рассуждений; в агентных сценариях, на 5,7 пункта на BFCL-v4 (многоходовый) и на 13,9 пункта на ACEBench-Agent.
- Критичными для успеха авторы называют две вещи: Дизайнер среды должен опираться на документы из большого предобучающего корпуса и иметь накапливаемую информацию о уже созданных средах.
Почему это важно
Непрерывное самоулучшение языковых агентов требует постоянно растущего и разнообразного пула тренировочных целей. Но существующие пулы сред, размеченные вручную, статически сгенерированные или основанные на «замороженном» верификаторе, держат распределение целей фиксированным, даже когда сама обучаемая модель становится сильнее и «перерастает» старые задачи. SPADE решает эту проблему, превращая само проектирование тренировочной среды в обучаемый компонент: среды генерируются той же моделью и подстраиваются под её текущий уровень. Авторы называют это конкретным шагом к открытому, не ограниченному заранее самоулучшению моделей.
Кому это важно
В первую очередь, исследователям и инженерам, которые строят пайплайны обучения с подкреплением для языковых агентов: тем, кто работает над рассуждением, многошаговым использованием инструментов и агентными бенчмарками. Метод предлагает способ автоматически расширять и усложнять тренировочные задачи по мере роста модели, не полагаясь на постоянную ручную разметку новых сред.
Как это применить
SPADE, исследовательский метод, а не готовый продукт: в источнике нет ни даты релиза, ни сведений о публикации кода или весов модели. Воспроизвести его напрямую пока может только команда, готовая самостоятельно собрать описанную схему, обучение модели в двух ролях (Дизайнер среды и Рассуждающий агент), настройку сигнала «сожаления» и построение сред с интерфейсом reset()/step(). Сведений о цене, лицензии или готовой инфраструктуре для использования в источнике нет.
Можно ли доверять
Материал, исследовательская работа с площадки Hugging Face Papers, то есть препринт: о независимом рецензировании в тексте не сказано. Приведённые улучшения (+5,3, +5,7, +13,9 пункта), это разницы с базовым вариантом, а не абсолютные значения точности, поэтому по ним трудно судить об итоговом уровне качества самой модели. Восемь бенчмарков, по которым усреднён прирост +5,3, поимённо не названы, как и то, насколько именно растёт преимущество SPADE в игровых сценариях с увеличением масштаба модели, источник говорит лишь, что оно «растёт». Сравнения с другими конкретными существующими системами самообучения в тексте нет.
Риски и подводные камни
Главное ограничение, в тексте нет абсолютных показателей качества, только относительные приросты, поэтому неясно, насколько хорош итоговый результат в абсолютных цифрах. Не названы ни все восемь бенчмарков, ни то, насколько именно растёт преимущество в игровых сценариях, оценить пределы применимости метода по одному источнику нельзя. Модели приходится одновременно выполнять две роли, придумывать среды и решать задачи в них, а во что это обходится по вычислениям, в источнике не сказано. Механизм «привилегированных подсказок», на основе которого считается сигнал сожаления, детально не раскрыт. Наконец, нет ни даты релиза, ни сведений о доступности кода или весов, так что независимо проверить или воспроизвести результаты пока не на чем.