UI-Mate: открытый ИИ-агент обновил рекорд управления компьютером

UI-Mate: открытый ИИ-агент обновил рекорд управления компьютером

Zihan Ding с соавторами представили UI-Mate, фундаментальную модель-агента с открытыми весами, которая управляет графическим интерфейсом компьютера: кликает, набирает текст и выполняет многошаговые задачи в приложениях. Авторы указывают, что развёртывание подобных агентов тормозят три проблемы: мало и однобоко размечены обучающие данные, инструкции пользователей часто расплывчаты, а сама модель ненадёжно доводит задачи до конца, рабочие процессы завязаны на привычки конкретного пользователя и невысказанные соглашения, из-за чего один и тот же запрос может выполняться по-разному от запуска к запуску.

UI-Mate строится на двух опорах. Первая, масштабируемый обучающий конвейер, привязанный к реальной среде: замкнутый цикл генерации данных сам создаёт задачи, строит для них окружение, прогоняет агента, отфильтровывает результаты, выравнивает баланс навыков и обучает модель, сначала дообучением с учителем (SFT), затем онлайн-обучением с подкреплением (RL), параллельно в множестве сред через единые связки «задача, верификатор». Вторая опора, обучение по демонстрациям в контексте: механизм превращает мультимодальные записи выполнения задачи в гибкие сценарии на уровне подзадач, агент следует показанным шагам, но при необходимости перепланирует действия по текущему состоянию экрана.

Отдельно авторы выпустили бенчмарк OSWorkerBench, 100 длинных офисных задач в 41 приложении, с двумя режимами оценки: только по инструкции или с демонстрацией-подсказкой. Демонстрационные наборы разделены на два вида: 33 задачи в режиме self-demo, где демонстрация, это успешный прогон самого сильного агента на той же самой задаче, и 45 задач в режиме variant-demo, где демонстрация, запись человека, выполняющего похожую, но не идентичную задачу.

В экспериментах версия UI-Mate-27B показала новый рекорд среди открытых моделей на общих бенчмарках управления компьютером: 77,0% на OSWorld-Verified и 66,2% на WindowsAgentArena. На собственном бенчмарке OSWorkerBench модель набрала 41,0% по строгому критерию успеха и 76,9% по критерию прогресса, это на 17,7 и 24,5 процентных пункта больше, чем у базовой модели Qwen3.6-27B, на которой построен UI-Mate. На подмножестве из 33 задач self-demo одна-единственная демонстрация подняла строгий успех с 17,2% до 35,4%, а прогресс, с 67,9% до 81,1%, заметно повысив надёжность в длинных многошаговых задачах. Страница проекта: ui-mate.github.io.

Ключевые факты

  • UI-Mate-27B, новый открытый рекорд по управлению компьютером: 77,0% на OSWorld-Verified и 66,2% на WindowsAgentArena
  • Два компонента системы: обучающий конвейер, привязанный к реальной среде (SFT + онлайн RL в параллельных окружениях), и обучение по демонстрациям в контексте с перепланированием на лету
  • Новый бенчмарк OSWorkerBench: 100 длинных офисных задач в 41 приложении, с режимами self-demo (33 задачи) и variant-demo (45 задач)
  • На OSWorkerBench UI-Mate обгоняет базовую модель Qwen3.6-27B на 17,7 п.п. по строгому успеху и на 24,5 п.п. по прогрессу
  • Одна демонстрация задачи поднимает строгий успех агента с 17,2% до 35,4%, а прогресс, с 67,9% до 81,1%

Почему это важно

Агенты, которые сами управляют интерфейсом компьютера, кликают, вводят текст, доводят многошаговые задачи до конца, одно из направлений, где открытые модели пока заметно отстают от закрытых систем. UI-Mate поднимает планку именно среди открытых моделей: 77,0% на OSWorld-Verified и 66,2% на WindowsAgentArena, новые лучшие результаты в этом классе. Отдельно важен сам приём, обучение по демонстрациям в контексте: агенту не нужно переобучаться под новый сценарий, достаточно один раз показать, как выполняется похожая задача.

Кому это важно

Разработчикам агентов для автоматизации рабочего стола и офисных приложений, как готовая открытая база для дообучения под свои сценарии. Исследователям в области обучения агентов, методика замкнутого конвейера данных и связок «задача, верификатор» применима не только к GUI-агентам. Авторам и пользователям бенчмарков, OSWorkerBench даёт более длинные и разнообразные задачи, чем большинство существующих тестов, и явно разделяет оценку с демонстрацией и без неё.

Как это применить

В источнике нет цены, условий лицензии или деталей выпуска кода, указана только страница проекта (ui-mate.github.io). Практический вывод из работы: если агенту нужно выполнить задачу, для которой нет прямого обучения, одна демонстрация похожего сценария заметно поднимает шанс довести дело до конца, с 17,2% до 35,4% по строгому критерию успеха на self-demo подмножестве. Это открывает путь к настройке агента под конкретный рабочий процесс пользователя без переобучения модели.

Можно ли доверять

Материал, самостоятельная публикация авторов на HuggingFace Papers (17 отметок, 1 комментарий на момент публикации), без независимой проверки третьей стороной. Показательно, что бенчмарк OSWorkerBench, на котором получены самые сильные относительные результаты (прирост к базовой модели), создан той же командой, что представила UI-Mate, это не делает цифры неверными, но означает, что сравнение проведено на собственном инструменте измерения. В тексте не указаны ни организация, ни дата выпуска, ни аффилиация авторов.

Риски и подводные камни

Заявленное превосходство ограничено кругом открытых моделей: в источнике нет прямого сравнения с закрытыми (проприетарными) системами, только формулировка «рекорд среди открытых весов». Нет данных о задержке или вычислительной стоимости на этапе применения (inference) для механизма обучения по демонстрациям в контексте, неизвестно, насколько он замедляет или удорожает работу агента в реальном использовании. Условия лицензии и выпуска кода за пределами ссылки на страницу проекта не раскрыты.