Представлен QwenGyre: фреймворк RL-обучения агентов на сверхдлинных задачах

В статье представлен QwenGyre, сквозной (end-to-end) фреймворк для онлайн-обучения с подкреплением (RL) агентов на сверхдлинных (xlong-horizon) задачах. Авторы отмечают, что агенты на основе больших языковых моделей всё чаще берутся за такие задачи: одно выполнение может занимать часы, включать сотни взаимодействий модели со средой и почти 1 млн токенов на один прогон (rollout).\n\nПрименение онлайн-RL к таким прогонам, по словам авторов, упирается в две проблемы. Первая: сильный разброс времени выполнения и долгие задержки прогонов приводят к массовому простою GPU. Вторая: сложное нелинейное ветвление порождает огромную избыточность траекторий, что подрывает эффективность обучения.\n\nQwenGyre отвечает на обе. Во-первых, он эластично перераспределяет GPU между сбором прогонов и обучением, не прерывая выполняющиеся сессии агентов. Во-вторых, его обработчик траекторий (trajectory processor) восстанавливает ветвящиеся истории, оценивает частичный прогресс и убирает дублирующиеся пути, чтобы ограничить стоимость обучения.\n\nРезультаты. При масштабировании на флагманскую модель авторов Qwen~3.8 2.4T с 700 тыс. токенов на прогон QwenGyre дал абсолютный прирост 6,0% на бенчмарке NL2RepoBench (с 52,5% до 58,5%) за 48 шагов. По оценкам на разных предметных областях обучающих данных фреймворк ускоряет обучение до 1,85 раза относительно подхода Colocate и до 1,78 раза относительно Async, это максимальные значения («до»), типичных или средних цифр в источнике нет.
Ключевые факты
- QwenGyre, сквозной фреймворк онлайн-RL для агентов на сверхдлинных задачах: часы работы, сотни шагов взаимодействия со средой, почти 1 млн токенов на прогон.
- Проблемы, на которые он нацелен: простой GPU из-за разброса времени и задержек прогонов, а также избыточность траекторий из-за нелинейного ветвления.
- Решение: эластичное перераспределение GPU между прогонами и обучением без прерывания живых сессий плюс обработка траекторий (восстановление ветвлений, оценка частичного прогресса, дедупликация путей).
- На флагманской модели Qwen~3.8 2.4T (700 тыс. токенов на прогон), прирост 6,0% на NL2RepoBench, с 52,5% до 58,5%, за 48 шагов.
- Ускорение до 1,85 раза относительно Colocate и до 1,78 раза относительно Async на разных наборах обучающих данных.
Почему это важно
Агенты всё чаще решают задачи, которые длятся часами и требуют сотен обращений к среде. Обучать их онлайн-RL дорого: по описанию авторов, GPU массово простаивают в ожидании долгих прогонов, а ветвящиеся траектории содержат много повторов. QwenGyre, попытка решить обе проблемы в одном фреймворке: он перераспределяет вычислительные ресурсы на ходу и сокращает дублирование в данных для обучения.
Кому это важно
Прежде всего командам, которые обучают агентов методами RL на длинных задачах (например, написание кода на уровне целого репозитория) и упираются в загрузку GPU и стоимость обучения. Также тем, кто следит за инфраструктурой обучения больших моделей: в статье сравнение идёт с подходами Colocate и Async.
Как это применить
Напрямую применить пока нечего: о выпуске QwenGyre или Qwen~3.8 2.4T, о коде и открытости в источнике ничего не сказано. Полезна сама постановка: разделять ресурсы между сбором прогонов и обучением динамически и чистить ветвящиеся траектории от дублей, прежде чем учиться на них.
Можно ли доверять
Это описание из аннотации самой статьи; все цифры, заявления авторов без независимой проверки. В источнике не названы авторы и организации, не сказано, кто разрабатывает Qwen и в чём считается размер 2.4T. Прирост на NL2RepoBench приведён только для флагманской модели, а ускорения, максимальные («до»); неизвестно, какие именно наборы данных использовались и проводилось ли сравнение с Colocate и Async на той же модели и оборудовании, что и запуск на NL2RepoBench.
Риски и подводные камни
Цифры ускорения, лучшие случаи, а не типичные: средних значений, времени обучения, числа GPU и затрат в источнике нет. Результат на бенчмарке показан для одной модели и одного запуска в 48 шагов, поэтому переносить его на другие модели и задачи нельзя без дополнительных данных. Также неизвестно, доступны ли фреймворк и модель для повторения экспериментов.