SPADE: ИИ сам придумывает себе тренировочные задачи и учится на них

SPADE: ИИ сам придумывает себе тренировочные задачи и учится на них

Для того чтобы языковой ИИ-агент продолжал улучшаться, ему нужен постоянно расширяющийся набор разнообразных и усложняющихся тренировочных задач. Проблема в том, что существующие наборы тренировочных сред, собранные вручную, статически сгенерированные или с зафиксированным проверяющим модулем, остаются неизменными по мере того, как сам обучаемый агент становится сильнее: планка сложности не растёт вместе с моделью.

Исследователи предложили SPADE (Self-Play in Adaptive Synthetic Executable Environments), фреймворк обучения с подкреплением через самоигру, в котором одна и та же большая языковая модель выполняет две роли одновременно. Первая роль, Дизайнер среды: он пишет полноценные, рассчитанные на много шагов тренировочные среды в виде исполняемого кода с интерфейсом reset()/step() в стиле OpenAI Gym. Вторая роль, Обучающийся агент: он действует внутри этих сред и учится решать поставленные в них задачи. Каждая среда, это связная многоходовая система с переходами состояний, функцией награды и кодом проверки результата, поэтому один и тот же интерфейс подходит и для задач на рассуждение, и для многошагового агентного использования инструментов.

Чтобы держать сложность заданий на нужном уровне, авторы вводят метрику "сожаления" (regret) агента, разницу между наградой, которую он получает с привилегированными подсказками, и без них. Оптимизируя именно этот сигнал, Дизайнер среды учится создавать задачи на грани текущих возможностей агента, но так, чтобы они оставались выполнимыми, а не превращались в неразрешимые.

По итогам экспериментов авторы выделяют два компонента, критически важных для успеха подхода: опору Дизайнера среды на документы, взятые из большого предобучающего корпуса, и накопленную память о ранее созданных средах. При масштабировании до моделей с 30 млрд параметров SPADE превзошёл сильнейший базовый вариант с фиксированным набором сред в среднем на +5.3 балла по восьми отложенным тестам на математику, науку, код и рассуждения. В задачах с использованием инструментов прирост составил +5.7 на многоходовом тесте BFCL-v4 и +13.9 на ACEBench-Agent. В игровых средах отрыв SPADE от лучшего базового варианта увеличивается по мере роста размера модели.

По словам авторов, превращение самого процесса проектирования тренировочных сред в обучаемый компонент, конкретный шаг к открытому, ничем не ограниченному самообучению ИИ-агентов.

Ключевые факты

  • Одна и та же нейросеть играет две роли: Дизайнер среды пишет исполняемый код тренировочных сред с интерфейсом reset()/step() как в OpenAI Gym, а Обучающийся агент действует в этих средах и решает поставленные в них задачи.
  • Сложность заданий регулируется через метрику "сожаления" агента, разницу в награде с подсказками и без них; Дизайнер среды ориентируется на неё, чтобы держать задачи на грани возможностей агента, но выполнимыми.
  • Критически важны два компонента: опора Дизайнера среды на документы из большого предобучающего корпуса и накопленная память о ранее созданных средах.
  • На моделях с 30 млрд параметров SPADE обошёл лучший вариант с фиксированными средами в среднем на +5.3 балла по восьми тестам на математику, науку, код и рассуждения.
  • В задачах на использование инструментов прирост составил +5.7 на многоходовом тесте BFCL-v4 и +13.9 на ACEBench-Agent; в игровых средах отрыв от базового варианта растёт вместе с размером модели.

Почему это важно

Обучение языковых агентов с подкреплением упирается в набор тренировочных сред: если он собран вручную или сгенерирован один раз и заморожен, сложность задач перестаёт расти вместе с моделью, и дальнейшее самоулучшение агента замедляется. SPADE предлагает решение, сделать сам процесс придумывания тренировочных задач обучаемой частью системы, а не фиксированным заранее ресурсом. Авторы называют это конкретным шагом к открытому, не ограниченному заранее заданными задачами самообучению агентов.

Кому это важно

В первую очередь, исследовательским командам, которые занимаются обучением языковых агентов с подкреплением, и разработчикам агентных ИИ-систем, где нужны навыки многошагового рассуждения и использования инструментов. Подход также интересен тем, кто масштабирует модели и упирается в нехватку достаточно разнообразных и сложных тренировочных данных по мере роста возможностей модели.

Как это применить

SPADE описан как методология обучения, а не готовый инструмент: в тексте источника не указаны ни дата публикации, ни доступность кода или обученных моделей, поэтому судить о готовом к использованию релизе преждевременно. Из описания метода следует, что для воспроизведения подхода нужны единый интерфейс сред в стиле reset()/step(), сигнал "сожаления" для оценки сложности задач относительно текущих возможностей агента, а также, по опыту авторов, опора Дизайнера среды на большой корпус документов и накопленная память о созданных средах.

Можно ли доверять

Материал, научная публикация с количественными результатами по восьми отложенным тестам на математику, науку, код и рассуждения, а также по отдельным сценариям использования инструментов и игровым средам. При этом в тексте не названы ни авторы, ни организация, стоящая за работой (имя в метаданных площадки не входит в текст самой публикации), не приведены ни точные значения показателей базовых моделей, ни сами базовые модели, только величина прироста. Это типичная для препринта картина: результаты заявлены и количественно подкреплены, но независимая проверка и подробности методики выходят за рамки доступного текста.

Риски и подводные камни

Результаты получены при масштабировании только до моделей с 30 млрд параметров, как подход поведёт себя на значительно более крупных или, наоборот, совсем маленьких моделях, из текста не следует. Приводятся только величины прироста (+5.3, +5.7, +13.9 балла), а не абсолютные значения показателей и не названия сравниваемых базовых моделей, что затрудняет независимую проверку масштаба улучшения. Обучение через самостоятельно генерируемый Дизайнером среды поток задач в принципе несёт риск того, что модель начнёт подстраивать сложность заданий под собственные текущие слабости или сильные стороны, этот сценарий в тексте не обсуждается и не исключён.