Claude Code и OpenClaw: RL-метод научил ИИ-агентов работать точнее

Агентные харнессы, программные обвязки, которые управляют обменом ИИ-агента со средой на длинных многошаговых задачах, заметно подняли качество работы агентов. Но обучение с подкреплением (RL) поверх таких сложных харнессов оставалось почти не изучено: масштабировать его на длинные задачи мешают фундаментальные сложности, пишут авторы.
В статье ClawGym II представлен единый black-box RL-фреймворк: харнесс воспринимается как непрозрачный «чёрный ящик», внутрь которого оптимизатору не нужно заглядывать. Сначала авторы строят инфраструктуру исполнения на песочницах (sandbox), она изолирует задачи и харнессы во временных песочницах, что позволяет запускать множество прогонов агента параллельно и в большом масштабе. Затем оптимизация политики агента отделяется от непрозрачного исполнения харнесса: на границе модели ставится прокси-сервер, который перехватывает все вызовы модели. Перехваченные вызовы собираются в префиксные деревья, чтобы восстановить многоходовые траектории диалога и повысить эффективность обучения; на восстановленной древовидной структуре адаптированы под эту задачу оба алгоритма, PPO с критиком и бескритиковый GRPO. На протяжении всей оптимизации фреймворк поддерживает согласованность между обучением и инференсом (training-inference consistency). Отдельно авторы вводят режим mix-harness training, совместное обучение одной модели сразу на разнородных харнессах.
В экспериментах на модели Qwen3-30A3B black-box RL поднял Pass@1 на бенчмарке ClawGym-Bench на 9,98 балла через харнесс OpenClaw и на 14,81 балла через харнесс Claude Code, причём обучение оставалось стабильным на протяжении 200-400 шагов оптимизации. Авторы также сообщают о стабильном приросте на более сложных задачах JobBench и OfficeQA, но конкретных цифр для этих двух бенчмарков в тексте не приводят. Итоговый вывод авторов: фреймворк даёт эффективную, стабильную и масштабируемую оптимизацию общих агентов через непрозрачные харнессы и поддерживает единое обучение сразу на разных исполняющих системах.
Ключевые факты
- ClawGym II, унифицированный black-box RL-фреймворк для обучения ИИ-агентов через агентные харнессы без доступа к их внутренней логике
- Инфраструктура на песочницах (sandbox) изолирует среды и харнессы, позволяя запускать множество прогонов агента параллельно и в большом масштабе
- Прокси-сервер на границе модели перехватывает вызовы модели и собирает их в префиксные деревья для адаптированных PPO (с критиком) и GRPO (без критика)
- На модели Qwen3-30A3B метод поднял Pass@1 на ClawGym-Bench на 9,98 балла через OpenClaw и на 14,81 балла через Claude Code, стабильно на 200-400 шагах оптимизации
- Режим mix-harness training позволяет совместно обучать одну модель сразу на нескольких разнородных харнессах; на JobBench и OfficeQA авторы тоже сообщают о приросте, но без конкретных цифр
Почему это важно
RL-обучение агентов через сложные харнессы (программные обвязки вроде OpenClaw или Claude Code, которые управляют обменом агента со средой на длинных задачах) до сих пор оставалось почти не изучено, масштабировать его мешали фундаментальные сложности. ClawGym II закрывает именно этот пробел: фреймворк относится к харнессу как к непрозрачному «чёрному ящику», отделяя оптимизацию политики агента от его внутренней логики, и держит обучение стабильным на протяжении сотен шагов оптимизации.
Кому это важно
В первую очередь, командам, которые обучают ИИ-агентов поверх существующих агентных харнессов (в том числе таких распространённых, как Claude Code и OpenClaw), и исследователям, занимающимся RL-обучением агентов на длинных многошаговых задачах. Возможность совместно обучать одну модель на нескольких разнородных харнессах (mix-harness training) особенно полезна командам, которые не хотят держать отдельную модель под каждый харнесс.
Как это применить
Ключевые компоненты фреймворка: инфраструктура на песочницах для изолированных масштабных прогонов; прокси-сервер на границе модели, перехватывающий её вызовы независимо от внутренней логики харнесса; сборка перехваченных вызовов в префиксные деревья для восстановления многоходовых траекторий; адаптированные под эту структуру алгоритмы PPO (с критиком) и GRPO (без критика); поддержание согласованности между обучением и инференсом на всём протяжении оптимизации; и режим mix-harness training для совместного обучения на разных харнессах.
Можно ли доверять
Материал, препринт научной статьи на HuggingFace Papers (первый автор, Хуатун Сун), без указания на независимое рецензирование; данные об авторском коллективе и институциях в тексте аннотации не приведены. Числовые результаты (9,98 и 14,81 балла Pass@1) измерены на бенчмарке ClawGym-Bench, который, судя по названию, создан теми же авторами, это стоит учитывать при оценке независимости замера. Прирост на JobBench и OfficeQA заявлен без конкретных цифр.
Риски и подводные камни
В тексте не уточняется, что именно означает «балл» прироста Pass@1, процентный пункт или другая единица измерения, это снижает точность интерпретации цифр 9,98 и 14,81. Результаты получены на одной модели (Qwen3-30A3B) и одном авторском бенчмарке (ClawGym-Bench); перенос на другие модели и независимые тесты не показан. Заявленный прирост на JobBench и OfficeQA не подкреплён числами, поэтому его масштаб проверить нельзя.