UI-Venus-2: базовая ИИ-модель для управления интерфейсом на телефоне, вебе и десктопе

Авторы представили UI-Venus-2, универсальную базовую модель ИИ-агента для управления графическим интерфейсом (GUI-агента), рассчитанную на мобильные устройства, веб и десктоп через единый замкнутый цикл «рассуждение, действие». Отправная точка работы, известная проблема отрасли: переход от моделей, заточенных под тестовые бенчмарки, к надёжным реальным приложениям буксует из-за ограниченного охвата сред, хрупкой постановки задач и ненадёжной проверки вознаграждения при обучении. Чтобы решить это, авторы одновременно масштабировали три направления. Во-первых, окружения: охват расширен до более чем 170 многоязычных мобильных приложений плюс нативные настольные операционные системы (какие именно, в источнике не уточняется). Во-вторых, задачи: для генерации инструкций, привязанных к конкретным функциям интерфейса, используется отдельный конвейер типа «глубокое исследование» (deep-research pipeline). В-третьих, проверка: для получения надёжного сигнала при обучении с подкреплением применяются оценщики уровня трассы и уровня отдельного примера, использующие визуальные ключевые точки интерфейса и голосование нескольких моделей. Отдельно в систему встроены механизмы, учитывающие безопасность, они обеспечивают контролируемое выполнение действий с существенными последствиями (например, необратимых операций в интерфейсе). По утверждению авторов, UI-Venus-2 предлагается как работоспособная, эффективная и открытая (open-source) базовая модель, продвигающая область в сторону более обобщаемых, проверяемых и способных к самоанализу агентов для реальных задач. Имена авторов, институциональная принадлежность, конкретные бенчмарк-показатели, сравнение с предыдущей версией UI-Venus, размер модели и объём обучающих данных в тексте источника не указаны.

Ключевые факты

  • UI-Venus-2, базовая модель ИИ-агента для управления GUI на мобильных, в вебе и на десктопе через единый цикл «рассуждение, действие»
  • Охват сред расширен до более чем 170 многоязычных мобильных приложений плюс нативные десктопные ОС
  • Задачи генерируются конвейером deep-research с привязкой инструкций к конкретным функциям интерфейса
  • Проверка вознаграждения при обучении использует оценщики уровня трассы и примера, визуальные ключевые точки и голосование нескольких моделей
  • В систему встроены механизмы безопасности для контролируемого выполнения действий с существенными последствиями; модель заявлена как открытая (open-source)

Почему это важно

GUI-агенты, умеющие управлять интерфейсом как человек, по клику, вводу текста и просмотру экрана, считаются перспективным способом автоматизации цифровых задач, но большинство таких моделей до сих пор заточены под тестовые бенчмарки и плохо переносятся в реальные условия. Проблему авторы называют явно: ограниченный охват сред, хрупкая постановка задач и ненадёжная проверка вознаграждения при обучении. UI-Venus-2 отвечает на это не точечным улучшением, а одновременным масштабированием сразу трёх измерений, сред, задач и верификации, что и заявлено как ключевой вклад работы.

Кому это важно

Модель адресована разработчикам ИИ-агентов и исследователям, которые строят системы автоматизации на базе визуального управления интерфейсом, ассистентов для мобильных приложений, веб-сервисов и настольных программ. Поскольку охват включает многоязычные приложения и нативные десктопные ОС, потенциально это интересно и командам, работающим не только с англоязычными интерфейсами.

Как это применить

Авторы описывают UI-Venus-2 как открытую (open-source) базовую модель, то есть предполагается, что с ней можно работать напрямую, а не только через закрытый API. В тексте источника, однако, не указаны ни ссылка на код или веса, ни конкретные условия лицензии, ни требования к вычислительным ресурсам, эти детали для практического использования нужно уточнять отдельно.

Можно ли доверять

Источник, технический отчёт (technical report) на arXiv, то есть заявления пока не прошли независимое рецензирование в привычном понимании. В тексте нет имён авторов, институциональной принадлежности, конкретных цифр по качеству (бенчмарк-показателей, сравнения с предыдущей версией UI-Venus или другими GUI-агентами), размера модели и объёма обучающих данных, всё это в аннотации отсутствует, и проверить заявленные преимущества по одному лишь тексту нельзя.

Риски и подводные камни

Главный риск GUI-агентов, выполнение необратимых или чувствительных действий в интерфейсе (удаление данных, платежи, отправка сообщений) без должного контроля; именно этому, по словам авторов, посвящены встроенные механизмы безопасности, ограничивающие выполнение таких действий. Но насколько эти механизмы надёжны на практике, в тексте не раскрывается, как и то, насколько заявленный охват в 170+ приложений и десктопных ОС репрезентативен для реальных сценариев использования вне тестовой среды.