RST: рекурсивный синтез сгенерировал 37 484 задачи для обучения ИИ-агентов

RST: рекурсивный синтез сгенерировал 37 484 задачи для обучения ИИ-агентов

Качественные обучающие данные для длинных многошаговых задач терминальных ИИ-агентов дороги в производстве: ручное составление обходится в сотни-тысячи долларов за задачу, потому что нужно одновременно удерживать согласованность условия, окружения, эталонного решения и верификатора. Ручной труд не масштабируется, а прямая генерация задач большими языковыми моделями часто эту согласованность ломает.

Авторы предлагают Recursive Synthetic Terminal Tasks (RST), фреймворк рекурсивного верифицированного синтеза таких задач. Процесс стартует с проверенных затравочных задач и на каждом раунде: расширяет эталонное решение, перестраивает верификатор и условие под новый порядок действий, проверяет результат в свежей песочнице и переиспользует принятые задачи как затравку для следующего раунда. За 15 таких раундов RST сгенерировал 37 484 задачи для терминальных агентов по цене примерно $0,05 за задачу.

Сложность задач от раунда к раунду растёт заметно: медианная длина эталонного решения увеличилась с 67 до 374 строк, медианное число выполняемых команд, с 40 до 244. Показатель успешности модели DeepSeek-V4-Pro (метрика pass@4) при этом упал с 90% на первом раунде до 2,5% на пятнадцатом.

Чтобы показать пользу таких данных для обучения, авторы собрали траектории модели Qwen3.5, отобранные методом rejection sampling (отбор по успешности попыток) на синтезированных задачах, и использовали их для supervised fine-tuning (дообучения с учителем). Дообучение подняло результаты Qwen3.5-27B и Qwen3.5-122B-A10B до 10 пунктов на бенчмарках Terminal-Bench 2, Terminal-Bench Hard и Long-Horizon Terminal Bench. Агентное обучение с подкреплением по методу PPO подняло Qwen3.5-27B до 49,44%, 32,00% и 22,07% на этих трёх бенчмарках соответственно, относительный прирост 20,0%, 41,2% и 21,9% к базовой модели.

По словам авторов, после 15 раундов предела у рекурсии не видно: выход синтеза и доля задач, прошедших верификацию, остаются стабильными даже при растущей сложности, это говорит о том, что процесс можно продолжать далеко за пределами описанного в статье масштаба.

Ключевые факты

  • RST рекурсивно синтезирует сложные многошаговые задачи для терминальных ИИ-агентов: каждый раунд расширяет эталонное решение, перестраивает верификатор и условие, проверяет результат в свежей песочнице и берёт принятые задачи как затравку для следующего раунда.
  • За 15 раундов получено 37 484 задачи по цене около $0,05 за штуку, против сотен-тысяч долларов при ручном составлении.
  • Сложность растёт: медианная длина эталонного решения выросла с 67 до 374 строк, медианное число команд, с 40 до 244; успешность DeepSeek-V4-Pro (pass@4) упала с 90% на первом раунде до 2,5% на пятнадцатом.
  • Дообучение Qwen3.5-27B и Qwen3.5-122B-A10B на этих данных подняло результаты до 10 пунктов на трёх бенчмарках; агентное PPO-обучение подняло Qwen3.5-27B до 49,44%, 32,00% и 22,07% на них же, прирост 20,0%, 41,2% и 21,9% к базовой модели.
  • После 15 раундов признаков предела нет: выход синтеза и доля прошедших проверку задач стабильны при растущей сложности, авторы считают, что процесс можно масштабировать и дальше.

Почему это важно

Длинные многошаговые задачи для терминальных ИИ-агентов, один из самых дорогих видов обучающих данных: ручное составление стоит сотни-тысячи долларов за задачу, потому что условие, окружение, эталонное решение и верификатор должны оставаться согласованными, а прямая генерация такими языковыми моделями эту согласованность обычно ломает. RST решает именно эту проблему: рекурсивная схема с проверкой на каждом шаге позволяет получать десятки тысяч согласованных задач почти бесплатно, по $0,05 за штуку, и при этом с заранее заданным ростом сложности.

Кому это важно

Разработчикам и исследовательским группам, которые строят и обучают агентных ассистентов для работы в терминале и командной строке, а также тем, кто занимается генерацией синтетических обучающих данных для агентных задач в целом: подход показывает, как рекурсивная верификация снимает необходимость в дорогом ручном труде людей-разметчиков.

Как это применить

Практический рецепт из статьи, двухшаговый: сначала на синтезированных RST-задачах собираются траектории модели (Qwen3.5) методом rejection sampling, затем на них проводится supervised fine-tuning; отдельно применяется агентное PPO-обучение поверх тех же задач. Оба пути дали измеримый прирост на трёх агентных бенчмарках, то есть подход применим как самостоятельный источник данных для дообучения и для обучения с подкреплением одновременно.

Можно ли доверять

Источник, карточка препринта на Hugging Face с полным текстом аннотации; методология описана подробно и с конкретными числами по всем этапам (рост сложности, стоимость, точность). В тексте не указаны аффилиации авторов и не приводится развёрнутое описание домена задач за пределами формулировки «терминальные агентные задачи», судить об этих деталях можно будет только по полному тексту статьи, если он появится.

Риски и подводные камни

В тексте не объясняется, чем именно вызвано падение pass@4 у DeepSeek-V4-Pro с 90% до 2,5% помимо роста сложности задач, то есть неясно, насколько метрика отражает реальную полезность задач для обучения, а не просто их трудность. Также не приведена совокупная стоимость всего прогона на 37 484 задачи (только цена за одну), и неизвестно, является ли оценка ручного труда в сотни-тысячи долларов собственным измерением авторов или общей отраслевой оценкой.