EvoSkill-GUI научил ИИ-агентов улучшать навыки без дообучения

EvoSkill-GUI научил ИИ-агентов улучшать навыки без дообучения

ИИ-агенты, которые выполняют долгие многошаговые задачи в графическом интерфейсе (GUI), регулярно сталкиваются с тем, что заранее составленный план ломается: всплывают окна, страницы грузятся с задержкой, элементы интерфейса переезжают на новое место. Существующие подходы дают агенту готовый набор «навыков», многократно используемых процедур, но собирают их один раз до развёртывания и затем считают статичными артефактами, а не знанием, которое должно улучшаться по ходу работы. Исследователи, стоящие за EvoSkill-GUI, исходят из того, что агентам нужны не более качественные статичные навыки, а навыки, которые можно пересматривать по обратной связи от исполнения прямо в момент работы, и без дополнительного обучения модели.

EvoSkill-GUI, training-free framework (обходится без дообучения модели): каждый навык устроен как структурированный пакет из нескольких файлов, включающий метаданные для поиска нужного навыка, исполняемые планы действий, резервные способы найти элемент на экране, правила восстановления после сбоя, вспомогательные инструменты доступности (accessibility) и записи о прошлых неудачах. Работает framework по циклу «отражение, правка, повторное использование» (reflect-revise-reuse): исполнитель вносит мгновенные правки прямо во время прогона задачи; отдельный «критик» разбирает неудачные попытки в условиях строгой информационной изоляции от исполнителя; после этого исполнитель через ограниченный интерфейс инструментов редактирует конкретные файлы навыка.

Framework проверили на трёх распространённых бенчмарках для GUI-агентов, покрывающих мобильные и десктопные платформы: MobileWorld, AndroidWorld и OSWorld. По заявлению авторов, EvoSkill-GUI стабильно улучшает результаты нескольких базовых моделей без какого-либо дополнительного обучения: максимальный прирост точности составил +16,2% на MobileWorld, +6,0% на AndroidWorld и +10,5% на OSWorld. Отдельно отмечается, что накопленные (эволюционировавшие) библиотеки навыков продолжают приносить пользу на смежных задачах, а не пересобираются заново с нуля для каждой новой задачи. Код framework выложен в открытом доступе на GitHub (ZJU-REAL/EvoSkill-GUI).

Ключевые факты

  • EvoSkill-GUI, training-free framework: агент правит собственные навыки работы с GUI по ходу выполнения задач, без дообучения базовой модели
  • Каждый навык, многофайловый пакет: метаданные поиска, исполняемые планы, резервная локализация элементов, правила восстановления после сбоя, инструменты accessibility и записи о неудачах
  • Цикл работы, reflect-revise-reuse: мгновенная правка исполнителем во время прогона, разбор неудач изолированным критиком, точечное редактирование файлов навыка
  • На бенчмарках MobileWorld, AndroidWorld и OSWorld прирост точности составил до +16,2%, +6,0% и +10,5% соответственно
  • Наработанные библиотеки навыков переиспользуются на смежных задачах, а не собираются заново с нуля; код открыт на GitHub

Почему это важно

GUI-интерфейсы динамичны: всплывающие окна, задержки загрузки и переезд элементов ломают заранее составленный план агента. Большинство существующих framework для агентных навыков этого не учитывают и считают навык готовым артефактом, а не тем, что должно меняться по ходу работы. EvoSkill-GUI предлагает решить это без затратного дообучения модели, навык правится сам, на основе того, что реально произошло при попытке его выполнить.

Кому это важно

Разработчикам агентов для автоматизации мобильных и десктопных интерфейсов, тем, кто строит ассистентов, выполняющих многошаговые задачи в реальных приложениях, а не в контролируемой песочнице. Подход интересен именно тем, кто уже упирается в хрупкость готовых сценариев при малейшем изменении интерфейса.

Как это применить

Framework оформлен как открытый код на GitHub (ZJU-REAL/EvoSkill-GUI) и не требует дообучения базовой модели, это переиспользуемая надстройка поверх агента. Навык хранится как пакет файлов (план, резервная локализация элементов, правила восстановления, доступность, история неудач), а цикл reflect-revise-reuse встраивается в существующий процесс выполнения задач агентом.

Можно ли доверять

Источник, препринт с полным текстом аннотации, но без указания авторов, институтов и даты публикации в самом тексте, а также без названий конкретных базовых моделей, на которых проверялся прирост. Числа приведены только как относительный прирост (+16,2%, +6,0%, +10,5%), абсолютные показатели точности и результаты сравнения с базовыми линиями в тексте не приводятся, так что независимо оценить масштаб улучшения по этим цифрам нельзя.

Риски и подводные камни

Заявленный эффект, самоотчёт авторов на трёх выбранных бенчмарках, без независимой проверки и без раскрытия механизма «строгой информационной изоляции» между исполнителем и критиком. Неизвестно, насколько устойчиво решение работает за пределами этих трёх сред и на моделях, которые не были упомянуты. Оценивать реальную применимость стоит с поправкой на то, что это результаты препринта, а не проверенное независимо исследование.