LEGO-RL улучшил результаты ИИ-агентов кода на SWE-bench Verified

Обучение с подкреплением (RL) агентов для кода всё чаще идёт не в упрощённом тренировочном стенде, а прямо внутри «боевого» харнесса, программной обвязки, которая ведёт агента через реальный рабочий цикл: вызовы инструментов, контекст репозитория, обратную связь от выполнения кода. Проблема в том, что нативная среда исполнения такого харнесса плохо совместима с обучением методом градиента политики: сбои среды и обман сигнала вознаграждения (reward hacking) искажают итоговый сигнал, по которому обучается модель, а расхождения между тем, что произошло во время прогона (rollout), и тем, что пересчитывает тренер, разрывают связь между реальным поведением агента и обновлением его политики.
Чтобы снять эту проблему, исследователи представили LEGO-RL, фреймворк, который соединяет нативные харнессы агентов для кода с масштабируемой RL-оптимизацией методом градиента политики, не меняя их внутреннюю логику работы. Метод стоит на трёх опорах. Первая, точность обучения: LEGO-RL проксирует LLM прямо внутри процесса харнесса, перехватывая «сырые» потоки генерации для выравнивания на уровне токенов и надёжного пересчёта логарифмических вероятностей на стороне тренера, это работает, даже если харнесс по ходу дела сжимает или заново пересобирает контекст. Вторая, надёжность исполнения: масштабируемая оркестрация песочниц с кэшированием образов среды и поэтапной защитой, которая снижает риск обмана сигнала вознаграждения. Третья, наблюдаемость: встроенный плагин, который автоматизирует валидацию и мониторинг, плюс Live UI для детальной диагностики траекторий агента.
Метод проверили, обучив разреженную MoE-модель Qwen3.5-35B-A3B алгоритмом GSPO сразу в трёх нативных харнессах агентов для кода, OpenHands SDK, Claude Code и OpenCode. На бенчмарке SWE-bench Verified результаты выросли во всех трёх случаях: на OpenHands SDK, с 64,0% до 70,4% (+6,4 процентного пункта), на Claude Code, с 62,4% до 68,2% (+5,8 процентного пункта), на OpenCode, с 57,2% до 66,6% (+9,4 процентного пункта). При этом корреляция вероятностей между прогоном и обучением всё время держалась выше 0,99, то есть то, что тренер считал политикой агента, соответствовало тому, что агент реально делал во время выполнения.
Источник, аннотация самой научной работы: в ней не указаны ни имена авторов, ни организация, ни то, публикуются ли код, веса модели или другие материалы. Сравнения с другими RL-фреймворками для агентов-кода в тексте тоже нет, приведены только собственные показатели LEGO-RL «до» и «после» на трёх харнессах.
Ключевые факты
- LEGO-RL, фреймворк, который встраивает RL-обучение методом градиента политики прямо в нативные харнессы агентов для кода, не переписывая их внутреннюю логику.
- Три опоры метода: точная синхронизация обучения и исполнения (проксирование LLM внутри процесса харнесса плюс пересчёт логарифмических вероятностей на стороне тренера), надёжная оркестрация песочниц с кэшированием образов и поэтапной защитой от обмана вознаграждения, и наблюдаемость через плагин мониторинга и Live UI.
- Метод проверили, обучив разреженную MoE-модель Qwen3.5-35B-A3B алгоритмом GSPO сразу в трёх харнессах: OpenHands SDK, Claude Code и OpenCode.
- На SWE-bench Verified результаты выросли во всех трёх харнессах: OpenHands SDK, с 64,0% до 70,4%, Claude Code, с 62,4% до 68,2%, OpenCode, с 57,2% до 66,6% (от +5,8 до +9,4 процентного пункта).
- Всё время обучения, во всех трёх харнессах, корреляция вероятностей между прогоном и тренировкой держалась выше 0,99.
Почему это важно
RL-обучение агентов для кода обычно идёт одним из двух путей: либо в упрощённой тренировочной среде, слабо похожей на то, с чем агент реально столкнётся в работе, либо прямо в «боевом» харнессе, но тогда сбои окружения и обман сигнала вознаграждения искажают то, чему учится модель, а расхождение между тем, что агент сделал во время прогона, и тем, что пересчитывает тренер, отвязывает обновление политики от реального поведения. LEGO-RL, попытка снять именно эту развилку: обучать модель методом градиента политики прямо внутри нативного харнесса, не переписывая его логику и не жертвуя точностью сигнала. Это важно тем, что решение работает поверх существующих харнессов, а не вместо них, не нужно строить отдельную упрощённую копию агентской среды специально под RL.
Кому это важно
Прежде всего это важно командам, которые сами обучают модели для агентов-кода методом RL и упираются в разрыв между упрощённым тренировочным стендом и реальным харнессом, которым агент пользуется в работе. В этой работе LEGO-RL проверили на трёх конкретных харнессах, OpenHands SDK, Claude Code и OpenCode, и во всех трёх случаях обучали одну и ту же модель, Qwen3.5-35B-A3B, просто прогоняя её через инфраструктуру каждого харнесса. Это также касается тех, кто ориентируется на SWE-bench Verified как на мерило качества агентов для кода: результат, ещё один пример того, что RL-дообучение поверх готового харнесса даёт измеримый прирост именно на этом бенчмарке.
Как это применить
У LEGO-RL три рабочих блока, и каждый закрывает свою часть проблемы. За точность обучения отвечает проксирование LLM прямо внутри процесса харнесса: система перехватывает «сырые» потоки генерации, выравнивает их на уровне токенов и пересчитывает логарифмические вероятности уже на стороне тренера, это продолжает работать, даже если харнесс по ходу дела сжимает историю или пересобирает её в другом формате. За надёжность исполнения отвечает масштабируемая оркестрация песочниц: образы окружения кэшируются, а на каждом этапе стоит защита, которая снижает риск обмана сигнала вознаграждения. За наблюдаемость, встроенный плагин, который автоматически валидирует и мониторит процесс, и Live UI с детальной диагностикой по каждой траектории агента. В таком виде метод проверили на разреженной MoE-модели Qwen3.5-35B-A3B: её обучили алгоритмом GSPO сразу в трёх харнессах, и на SWE-bench Verified результаты выросли с 64,0% до 70,4% на OpenHands SDK, с 62,4% до 68,2% на Claude Code и с 57,2% до 66,6% на OpenCode. Публикуют ли авторы код или веса модели, источник не сообщает.
Можно ли доверять
Это отчёт о собственном эксперименте авторов в форме аннотации научной статьи: сравнение идёт по системе «до и после» на показателях самого LEGO-RL, без сопоставления с другими RL-фреймворками для агентов-кода, насколько прирост специфичен именно для этого метода, а не воспроизводим более простыми средствами, из текста не видно. Аннотация не называет ни авторов, ни организацию, которая стоит за работой, оценить репутацию команды по одному этому тексту нельзя. При этом сам числовой результат внутренне последователен: прирост показан отдельно на трёх разных харнессах, а не одной усреднённой цифрой, и сопровождается метрикой согласованности обучения (корреляция выше 0,99), а не только итоговым процентом на бенчмарке.
Риски и подводные камни
Главный риск признают сами авторы, это обман сигнала вознаграждения (reward hacking): во время RL-обучения агент может находить способ получать высокую награду, не решая задачу по существу, и именно против этого в LEGO-RL встроена поэтапная защита на уровне оркестрации песочниц. Насколько эта защита снижает, а не убирает риск полностью, источник не уточняет, формулировка в тексте про «смягчение», а не про полное устранение. Результаты показаны только для одной модели (Qwen3.5-35B-A3B) и трёх конкретных харнессов, перенесётся ли эффект на другие модели, размеры или харнессы, не проверено. Данных о вычислительных затратах на обучение и о том, публикуются ли код, веса модели или дополнительные материалы, в источнике тоже нет.