Alibaba выпустила Qwen-UI-Agent: рекорд на мобильных ИИ-агентах против GPT-5.6 и Gemini

Команда представила видение GUI-агента как универсального исполнителя задач на любых цифровых устройствах: он должен надёжно работать на реальных устройствах, выполнять сценарии на разных платформах, сочетать управление графическим интерфейсом с выполнением команд в командной строке, доводить до конца долгие многошаговые задачи, самостоятельно инициировать полезные для пользователя действия и с минимальным участием человека улучшать собственные навыки. Руководствуясь этим видением, авторы построили Qwen-UI-Agent, фундаментальную модель GUI-агента, ориентированную на реальное применение и охватывающую мобильные устройства, работу с компьютером (computer-use), браузер и режим глубокого поиска (DeepSearch).
Архитектурно агент сочетает набор разнородных песочниц (sandbox-сред) с крупномасштабным рантаймом на реальных мобильных устройствах. Его единое пространство действий объединяет операции с графическим интерфейсом и выполнение команд в CLI, при этом за один ход модель может выдавать сразу пакет действий. Данные для обучения пополняются через механизм в духе AutoResearch: агенты сами конструируют задачи и среды, диагностируют неудачи и планируют следующие итерации обучения. Обучение построено на онлайн-RL на траекториях длиной свыше 100 ходов, а для ускорения сбора опыта одновременно используется более 10 000 параллельных сред. Лёгкий слой-обвязка (harness) поддерживает проактивный запуск сервисов и сохранение состояния сценариев на мобильных устройствах и компьютере.
По результатам оценки на широком наборе бенчмарков Qwen-UI-Agent устанавливает рекорд (SOTA) на тестах для мобильных устройств: 82,1% на MobileWorld, 92,2% на MobileWorld-Real и 97,5% на AndroidDaily. На задачах работы с компьютером агент набирает 79,5% на OSWorld-Verified и 40,0% по метрике частичного прогресса на OSWorld-v2, это описывается как конкурентный результат по сравнению с топовыми моделями, включая Opus 4.8, Gemini 3.1 Pro и GPT-5.6 Sol. На задачах работы в браузере результат, 73,6% на WebArena, а на тесте привязки к элементам интерфейса (GUI grounding) ScreenSpot-Pro, 81,5%.
Первый автор технического отчёта, Ханчжан Чжоу; материал опубликован как препринт на странице Hugging Face Papers и на момент сбора набрал 102 отметки и 3 комментария в обсуждении.
Ключевые факты
- Qwen-UI-Agent, единая модель GUI-агента для мобильных устройств, компьютера, браузера и режима DeepSearch
- Рекорд (SOTA) на мобильных бенчмарках: 82,1% MobileWorld, 92,2% MobileWorld-Real, 97,5% AndroidDaily
- На компьютерных задачах, 79,5% OSWorld-Verified и 40,0% частичного прогресса на OSWorld-v2, конкурентно с Opus 4.8, Gemini 3.1 Pro и GPT-5.6 Sol
- На браузерных задачах, 73,6% WebArena; привязка к элементам интерфейса (ScreenSpot-Pro), 81,5%
- Обучение, онлайн-RL на траекториях свыше 100 ходов при более чем 10 000 параллельных сред одновременно
Почему это важно
Разработчики GUI-агентов годами упирались в разрыв между лабораторными тестами и реальными устройствами: модель хорошо работает в эмуляторе, но теряется на настоящем телефоне или компьютере с их непредсказуемым интерфейсом. Qwen-UI-Agent сделан именно с прицелом на реальное применение, обучение идёт частично на большом рантайме реальных мобильных устройств, а не только в песочницах, и это даёт рекордные показатели на тестах, приближенных к повседневному использованию телефона.
Кому это важно
В первую очередь, разработчикам ИИ-агентов и автоматизации: результат показывает, что один агент способен покрывать сразу мобильные устройства, компьютер, браузер и сложные многошаговые сценарии, не требуя отдельной модели под каждую платформу. Также это интересно исследователям в области reinforcement learning, обучение на траекториях свыше 100 ходов с более чем 10 000 параллельных сред само по себе показатель масштаба инфраструктуры, доступной для подобных экспериментов.
Как это применить
Технический отчёт описывает архитектуру и результаты тестов, но не раскрывает условия доступа, цену или сроки публичного релиза Qwen-UI-Agent, об этом в тексте ничего не сказано. Потенциальное применение, которое очевидно из описанной архитектуры, автоматизация повторяющихся задач на телефоне и компьютере, сценарии с длинными цепочками действий и проактивные фоновые сервисы, которые агент может запускать сам.
Можно ли доверять
Все цифры взяты из технического отчёта самих разработчиков модели, а не из независимого стороннего тестирования, на бенчмарках вроде OSWorld и WebArena компании нередко подбирают выгодную для себя конфигурацию сравнения. Материал опубликован как препринт на Hugging Face Papers, первый автор, Ханчжан Чжоу с соавторами; полный список соавторов и рецензирование в тексте не указаны.
Риски и подводные камни
Агент, который сам инициирует сервисы и выполняет команды в CLI параллельно с управлением интерфейсом, расширяет пространство возможных ошибок и непредвиденных действий по сравнению с обычным GUI-агентом, ограниченным кликами и вводом текста. В отчёте не приводится информация о встроенных ограничениях безопасности или тестах на нежелательное поведение, этот аспект остаётся за рамками описанных бенчмарков.
«Qwen-UI-Agent показывает рекордные результаты на бенчмарках для мобильных устройств и конкурентные результаты на компьютерных и браузерных задачах, на уровне таких топовых моделей, как Opus 4.8, Gemini 3.1 Pro и GPT-5.6 Sol.»
— из технического отчёта Qwen-UI-Agent