Microsoft выпустила Echoverse, синтетические миры для тренировки ИИ-агентов

Microsoft Research представила Echoverse, конвейер для создания синтетических тренировочных сред для агентов, работающих с компьютерными интерфейсами (браузер, приложения, внутренние консоли). Идея в том, что обучение и доработка среды, это не два отдельных этапа, а один замкнутый цикл: модель прогоняют в синтетическом мире, находят, где она проваливается, делают этот участок мира и его проверки более требовательными и достоверными, дообучают модель на новом сигнале, и повторяют. Обычное дообучение улучшает только модель; здесь тот же прогон, что оценивает модель, одновременно улучшает и мир, который её оценивал.
Всего построено двенадцать миров: десять «глубоких» доменных миров (переписка, техническая работа, регулируемые записи вроде медицинских или банковских, работа с сообществами, медиа, путешествия) и два «навыковых» мира, каждый из которых отрабатывает один конкретный элемент интерфейса во множестве форм, календарные виджеты выбора даты и вложенные фильтры поиска. В ключевом эксперименте модель на 9 миллиардов параметров, обученная сразу на всех двенадцати мирах, почти удвоила базовый результат, с 36,5% до 67,1%, отстав от GPT-5.4 всего на 14 процентных пунктов.
Из экспериментов Microsoft вывела несколько закономерностей. Во-первых, важна именно достоверность симуляции, а не количество миров: на упрощённых версиях тех же сайтов модель, наоборот, теряла в качестве, тогда как на глубоких, росла. Во-вторых, агенты почти всегда спотыкаются на одних и тех же элементах интерфейса, например, на выборе даты или вложенных фильтрах; если отдельно отработать эти элементы во множестве вариаций, модель начинает уверенно управлять ими даже в доменах, которых не видела при обучении. В-третьих, совместное «доращивание» модели, мира и проверяющего механизма (верификатора) улучшает все три компонента сразу: по мере того как мир становится точнее, а задачи в нём, сложнее, модель подтягивается следом. В-четвёртых, обучение с подкреплением (RL) против этих миров, где наградой служит проверка по реальному состоянию базы данных, даёт агенту больше, чем простое подражание примерам: итоговая модель выполняет задачи за меньшее число шагов.
Десять доменных миров опираются на реальные данные там, где это возможно: EchoStay заполнен реальными объявлениями, хозяевами и отзывами из открытого набора InsideAirbnb, а бронирование в нём проходит примерно через 87 маршрутов и 23 таблицы базы данных, но ни один шаг не завершается простым экраном подтверждения, состояние должно измениться по-настоящему. EchoForum построен на публичном корпусе из 2,55 млн реальных комментариев. Там, где готовых данных нет, почта (EchoMail), календарь, банк (EchoBank), медицинские записи (EchoCare), состояние генерируется по строгим правилам и остаётся внутренне непротиворечивым: письмо в EchoMail проходит путь от черновика до доставки, ответа и метки, а каждое действие в EchoCare пишется в журнал аудита. Задачи в среднем требуют от 5 до 20 действий подряд и засчитываются только тогда, когда изменилось реальное состояние системы, а не то, что показано на экране.
Отдельный навыковый мир посвящён выбору даты: он воспроизводит один и тот же элемент управления в шести базовых вариантах интерфейса в 10 контекстах и ещё в 10 незнакомых моделью контекстах, вплоть до календарей-«теплокарт» и колёс прокрутки для выбора месяца. Самые сложные задачи там требуют не просто нажать нужную дату, а сначала вычислить её: например, определить, какое число соответствует формулировке «последний четверг января 2026 года» или «10 рабочих дней после даты начала».
Каждая задача в системе Echoverse снабжена «ключом ответа», полученным SQL-запросом к реальной базе данных: чтение проверяется по смысловому совпадению значения ("$288" засчитывается вместо "$287.62"), запись, по разнице состояния базы до и после действия, а смешанные задачи оцениваются по худшему из двух показателей. Каждая сгенерированная задача дополнительно проверяется тем, что агент, управляющий настоящим интерфейсом в браузере, действительно способен её решить; если нет, ошибку помечают, к какому именно слою она относится (база данных, бэкенд, фронтенд, текст задания или верификатор), и точечно чинят этот слой, пока доля решаемых задач не перестанет расти. Прошедшие проверку задачи решает модель GPT-5.4, а верификатор отбирает только успешные траектории, они и становятся данными для обучения (SFT).
Microsoft публикует четыре из двенадцати миров вместе с кодом, данными и проверяющими механизмами в открытом доступе, на GitHub (microsoft/Echoverse) и Hugging Face, а также выпустила технический отчёт с полным описанием методики.
Ключевые факты
- Microsoft построила 12 синтетических тренировочных миров: 10 доменных (почта, банк, медзаписи, форум, путешествия и др.) и 2 навыковых, выбор даты и вложенные фильтры
- Модель на 9 млрд параметров, обученная на всех 12 мирах, почти удвоила точность, с 36,5% до 67,1%, отстав от GPT-5.4 на 14 процентных пунктов
- Упрощённые (мелкие) версии тех же сред снижают качество агента, важна именно достоверность симуляции, а не число сред
- Отдельная отработка повторяющихся элементов интерфейса (даты, фильтры) переносится на домены, которых модель не видела в обучении
- Обучение с подкреплением с наградой от проверки реального состояния базы данных снижает число шагов агента до цели; 4 из 12 миров с кодом, данными и верификаторами выложены на GitHub и Hugging Face
Почему это важно
Это методический прорыв, а не просто новый бенчмарк: Microsoft показывает, что качество агента для работы с компьютером упирается не в размер модели и не в число тренировочных сценариев, а в достоверность самой среды обучения и в цикл, где модель, среда и проверяющий механизм улучшаются вместе. Рост с 36,5% до 67,1% на одной и той же 9-миллиардной модели, это эффект от смены подхода к данным, а не от новой архитектуры.
Кому это важно
Прежде всего, командам, которые разрабатывают и обучают ИИ-агентов для работы с интерфейсами: почтой, календарями, банковскими и медицинскими системами, внутренними консолями. Полезно и исследователям бенчмарков компьютерного использования, и компаниям, которые хотят автоматизировать работу с закрытыми корпоративными системами, куда нельзя пускать агента напрямую для тренировки.
Как это применить
Microsoft выложила четыре из двенадцати миров вместе с кодом, данными и верификаторами на GitHub (microsoft/Echoverse) и Hugging Face, а также опубликовала технический отчёт с описанием методики. Команды могут использовать эти артефакты как основу для собственных тренировочных сред или воспроизвести подход: строить не широкий, а глубокий и достоверный мир под конкретный домен, отдельно отрабатывать проблемные элементы интерфейса и обучать агента через RL с проверкой по реальному состоянию базы данных, а не по внешнему виду экрана.
Можно ли доверять
Материал, официальный пост исследовательского блога Microsoft Research с опорой на технический отчёт, конкретные числовые результаты (36,5% → 67,1%, разрыв в 14 пунктов от GPT-5.4) и частичное открытие кода, данных и верификаторов для независимой проверки. Это повышает доверие к методике, но сравнение всё же построено на собственном бенчмарке и собственной модели Microsoft, поэтому воспринимать цифры стоит как результат конкретного эксперимента компании, а не как независимо подтверждённый универсальный показатель.
Риски и подводные камни
Сама Microsoft признаёт компромисс: синтетический мир жертвует частью реалистичности открытого веба ради полного контроля и воспроизводимости, сайты в нём не меняются со временем, как настоящие. Это создаёт риск разрыва между синтетикой и реальным вебом: агент, натренированный на выверенных синтетических копиях банка или почты, может столкнуться с иначе устроенным реальным интерфейсом. Кроме того, построение по-настоящему глубокого мира (с непротиворечивым состоянием, правами доступа и историей действий), трудоёмкий процесс, и Microsoft прямо говорит, что именно нехватка такой глубины, а не число сред, было узким местом всего направления.
«Скриншот может показать, как выглядит интерфейс, но только работающий мир показывает, к чему привело действие.»
— исследователи Microsoft, блог проекта Echoverse