Qwen3.6 прибавил 14,4 и 18,0 п.п. на Terminal-Bench 2.1 благодаря новому методу обучения

Qwen3.6 прибавил 14,4 и 18,0 п.п. на Terminal-Bench 2.1 благодаря новому методу обучения

Исследователи описывают проблему обучения терминальных (командно-строчных) агентов: по мере роста возможностей фронтир-моделей окружения, синтезированные «с нуля», быстро становятся слишком лёгкими и перестают давать полезный сигнал для обучения. Существующие методы совместной эволюции (co-evolution) итеративно синтезируют окружения около текущей границы обучаемости модели, опираясь на слабые места, выявленные в прогонах (rollouts), но их зависимость от прогонов по текущей политике (on-policy) ограничивает обобщение и не даёт стабильного сигнала по мере усиления модели.

Авторы предлагают «эволюцию окружений» (environment evolution), подход, который наращивает сложность окружений постепенно и вне текущей политики (off-policy), а сами эволюционировавшие окружения выдаются поколение за поколением синхронно с ходом обучения, чтобы обеспечить непрерывный обучающий сигнал. Из формулировки многошаговой (multi-turn) цели обучения авторы выводят три направления, влияющих на сложность окружения, и реализуют эволюцию по этим направлениям через специально сконструированный («loop-engineered») мультиагентный харнесс (вспомогательный механизм с несколькими агентами).

В количественных экспериментах с прогонами моделей Hy4 preview, Claude Opus 5 и GPT-5.6 Sol метод стабильно порождал более сложные окружения, чем сравниваемые подходы. Эффективность подхода проверена на моделях Qwen3.6-27B и Qwen3.6-35B-A3B простым обучением с подкреплением на длинных горизонтах (long-horizon RL): на бенчмарке Terminal-Bench 2.1 результат вырос на 14,4 и 18,0 процентного пункта соответственно.

Ключевые факты

  • Метод «эволюция окружений» наращивает сложность обучающих сред для терминальных агентов вне текущей политики (off-policy) и выдаёт их поколение за поколением синхронно с обучением, а не подстраивается под прогоны модели «на лету», как существующие co-evolution методы.
  • Три направления эволюции сложности окружения выведены из формулировки многошаговой (multi-turn) цели обучения и реализованы через специально сконструированный мультиагентный харнесс.
  • В количественных экспериментах с прогонами моделей Hy4 preview, Claude Opus 5 и GPT-5.6 Sol метод стабильно создавал более сложные окружения, чем альтернативы.
  • Обучение с подкреплением на длинных горизонтах с эволюцией окружений подняло результат Qwen3.6-27B на бенчмарке Terminal-Bench 2.1 на 14,4 процентного пункта, а Qwen3.6-35B-A3B, на 18,0 процентного пункта.
  • Существующие методы совместной эволюции окружения и модели зависят от прогонов по текущей политике, что ограничивает обобщение и постоянство обучающего сигнала по мере роста возможностей модели, заявленная проблема, которую и решает новый подход.

Почему это важно

По мере роста возможностей фронтир-моделей окружения, синтезированные «с нуля», быстро становятся слишком лёгкими и перестают давать полезный обучающий сигнал. Существующие методы совместной эволюции (co-evolution) окружения и агента опираются на прогоны по текущей политике (on-policy rollouts), что ограничивает их обобщение и не обеспечивает стабильный сигнал по мере усиления модели. Авторы предлагают «эволюцию окружений», способ наращивать сложность заранее и вне текущей политики (off-policy), поколение за поколением синхронно с ходом обучения.

Кому это важно

Тем, кто обучает терминальных (командно-строчных) агентов методами обучения с подкреплением, и разработчикам синтетических тренировочных сред, которые уже упираются в потолок сложности таких окружений по мере роста возможностей модели.

Как это применить

Метод выводит три направления, по которым можно наращивать сложность окружения, из формулировки многошаговой (multi-turn) цели обучения и реализует их через специально сконструированный («loop-engineered») мультиагентный харнесс. Работоспособность проверена простым обучением с подкреплением на длинных горизонтах (long-horizon RL) на моделях Qwen3.6-27B и Qwen3.6-35B-A3B: на бенчмарке Terminal-Bench 2.1 результат вырос на 14,4 и 18,0 процентного пункта соответственно.

Можно ли доверять

В количественных экспериментах с прогонами на моделях Hy4 preview, Claude Opus 5 и GPT-5.6 Sol метод стабильно порождал более сложные окружения, чем сравниваемые подходы. В доступном тексте не указаны авторские аффилиации и институты, а также не уточняется, использовались ли эти три модели для генерации эволюционировавших окружений, для их оценки или для того и другого одновременно.

Риски и подводные камни

Устройство «loop-engineered» мультиагентного харнесса и то, как именно определяются три направления эволюции сложности, в тексте не раскрыты, независимо оценить метод по одной аннотации нельзя. Не указаны сроки проведения экспериментов и состав авторского коллектива.