Microsoft выпустила Orchard, открытый фреймворк для обучения ИИ-агентов

Microsoft выпустила Orchard, открытый фреймворк для обучения ИИ-агентов

Microsoft Research выпустила Orchard, открытый фреймворк для масштабируемого и недорогого исследования агентного ИИ. В основе лежит Orchard Env: облегчённый сервис-среда на Kubernetes, который без изменений подходит для агентов разных типов, программирующих, работающих в браузере и выполняющих личные поручения, и покрывает весь цикл от сбора обучающих данных до прогонов обучения с подкреплением и оценки. Ключевая особенность Orchard Env, способность обучать агентов прямо внутри реальных «упряжек» (harness), которыми они управляются в проде: Claude Code, Codex, OpenClaw, ZeroClaw. Обычно открытые инструменты обучения не справляются с такими многоэтапными, стейтфул-системами, и исследователям приходится тренировать модель на упрощённой заглушке, а затем разворачивать в настоящей среде, из-за этого возникает рассинхрон. Orchard решает проблему лёгким прокси, который записывает вызовы модели самой упряжки как обучающие данные, пока каждый прогон выполняется в своём контейнере.

Вместе с инфраструктурой Microsoft Research выпустила три готовых рецепта обучения, Orchard-SWE, Orchard-GUI и Orchard-Claw, а также обучающие данные и методики оценки к ним.

Orchard-SWE учит агентов чинить реальный код: он построен на фреймворке Mini-SWE-Agent и оценивается на бенчмарке SWE-bench Verified. Для обучения дистиллировали 107 000 взаимодействий агента из двух открытых моделей, MiniMax-M2.5 и Qwen3.5-397B, по широкому набору задач с GitHub. Обучение с учителем использует «зачёт по частям»: система учится на продуктивных фрагментах даже тех попыток, где агент не довёл исправление до конца, вместо того чтобы отбрасывать их целиком. Дальше идёт обучение с подкреплением: метод Balanced Adaptive Rollout выжимает максимум из редких сигналов успеха, к нему добавлены две техники «плотной награды», дистилляция на политике (более сильная модель-учитель пошагово оценивает решения агента) и модель вознаграждения за процесс (ИИ-судья поощряет корректный порядок работы, написание теста, воспроизводящего баг, проверку фикса, сохранение старого поведения, независимо от итогового результата). Наконец, отдельная модель ценности на 4 млрд параметров, обученная на траекториях из 20 предыдущих экспериментов, переранжирует несколько вариантов решения и выбирает лучший. В сумме это подняло Orchard-SWE с базовых 61,4% на SWE-bench Verified до 69,1% после Balanced Adaptive Rollout, до 69,7% с техниками плотной награды, новый рекорд среди открытых моделей сопоставимого размера (около 3 млрд активных параметров), и до 73,0% с переранжированием моделью ценности, что приближается к результатам проприетарных систем более чем в 10 раз крупнее.

Orchard-GUI обучает браузерного агента на базе визуально-языковой модели с 4 млрд параметров при относительно скромной разметке: 400 дистиллированных демонстраций плюс 2200 открытых обучающих задач. При этом модель показывает 74,1% на WebVoyager, 67,0% на Online-Mind2Web и 64,0% на DeepShop, в среднем 68,4% по трём бенчмаркам веб-навигации, что ставит её среди сильнейших открытых веб-агентов и конкурентоспособной с более крупными закрытыми моделями.

Orchard-Claw нацелен на бытовые задачи личного помощника, чтение и составление писем, работу с календарём, поиск информации. Его обучили всего на 200 синтетических задачах, а оценивали на бенчмарке Claw-Eval, охватывающем реалистичные рабочие сценарии: агент успешно решает 59,6% задач с правом на три попытки, а в связке с более сильной системой ZeroClaw доля растёт до 73,9%. Orchard-Claw тренировали сразу в нескольких реальных упряжках, ReACT, ZeroClaw, OpenClaw и Codex, и это заметно повышает надёжность: например, под управлением Codex успешность выросла с 18,6% у необученной модели до 51,5% после обучения Orchard.

Авторы называют главный вывод проекта: слой среды исполнения, это то, что определяет стоимость и воспроизводимость исследований агентного ИИ. Делая Orchard Env открытым, лёгким и переиспользуемым, команда снимает необходимость строить изолированные среды с нуля или зависеть от закрытых облачных сервисов; тот же сервис годится и для генерации данных, и для RL-прогонов, и для оценки моделей. На перспективу Microsoft Research видит направление в накоплении обучающего опыта: вместо того чтобы выбрасывать траектории после завершения прогона, их предлагается сохранять как переиспользуемый актив, например, дистиллировать в модели ценности, чтобы каждое следующее поколение агентов наследовало и расширяло опыт предыдущих, а не училось с нуля. Эффективность данных, продемонстрированная Orchard-GUI, по мнению авторов, говорит о том, что более крупных веб-агентов можно будет обучать без больших объёмов вручную размеченных данных.

Ключевые факты

  • Orchard, открытый фреймворк Microsoft Research с ядром Orchard Env: переиспользуемая среда на Kubernetes для обучения и оценки агентов в кодинге, веб-навигации и личных задачах, включая обучение прямо внутри реальных упряжек Claude Code, Codex, OpenClaw, ZeroClaw
  • Orchard-SWE на ~3 млрд активных параметров достиг 69,7% (73,0% с переранжированием моделью ценности) на SWE-bench Verified, рост с базовых 61,4%, приближение к системам более чем в 10 раз крупнее
  • Обучение Orchard-SWE использует 107 000 дистиллированных взаимодействий из моделей MiniMax-M2.5 и Qwen3.5-397B, а также 4-миллиардную модель ценности, обученную на 20 прошлых экспериментах
  • Orchard-GUI, 4-миллиардная визуально-языковая модель, обученная на 400 демонстрациях и 2200 задачах, набрала в среднем 68,4% на бенчмарках WebVoyager, Online-Mind2Web и DeepShop
  • Orchard-Claw, обученный на 200 синтетических задачах, решает 59,6% сценариев Claw-Eval (73,9% в связке с ZeroClaw); под упряжкой Codex обучение подняло успешность с 18,6% до 51,5%

Почему это важно

Исследователи агентного ИИ упираются в закрытую инфраструктуру: собственные песочницы, закрытые пайплайны обучения и проприетарные датасеты, которые большинству недоступны и невоспроизводимы. Orchard снимает именно этот барьер, выкладывая в открытый доступ саму среду исполнения, а не только веса моделей, и демонстрирует, что при таком подходе компактные модели на 3, 4 млрд параметров приближаются к результатам систем на порядок крупнее.

Кому это важно

Исследовательским командам и инженерам, которые строят собственных агентов для разработки, веб-навигации или личных ассистентов и упираются в стоимость и воспроизводимость обучающей инфраструктуры. Полезно и тем, кто использует упряжки вроде Codex, OpenClaw или Claude Code в проде, Orchard позволяет обучать агента прямо внутри той упряжки, в которой он будет развёрнут, без рассинхрона между обучением и эксплуатацией.

Как это применить

Microsoft Research выкладывает весь стек Orchard в открытый доступ: сервис Orchard Env на Kubernetes, три готовых рецепта обучения (Orchard-SWE, Orchard-GUI, Orchard-Claw), а также обучающие данные и методики оценки к каждому из них, их можно взять как основу для собственных агентов или как эталон для сравнения.

Можно ли доверять

Материал, официальный пост исследовательского блога Microsoft Research с числовыми результатами на общепринятых бенчмарках (SWE-bench Verified, WebVoyager, Online-Mind2Web, DeepShop, Claw-Eval), что позволяет независимо проверить заявленные цифры. При этом в тексте нет имён конкретных авторов и даты публикации, а сравнение «более чем в 10 раз крупнее модели» не называет конкретную систему-эталон.

Риски и подводные камни

Источник не называет ни авторов проекта, ни конкретные модели-фронтир, с которыми сравнивают Orchard-SWE, ни точный график публикации кода и датасетов, сказано лишь, что материалы «выпускаются». Организации, создавшие модели MiniMax-M2.5 и Qwen3.5-397B, использованные для дистилляции данных Orchard-SWE, в тексте тоже не указаны.