Исследователи представили DeskForge: данные для ИИ-агентов, работающих за компьютером

Исследователи представили DeskForge: данные для ИИ-агентов, работающих за компьютером

Агентам, которые управляют компьютером, нужно уверенно находить цели действий в сложных сценах рабочего стола: там несколько приложений, перекрывающиеся окна и похожие друг на друга элементы управления. По словам авторов, существующие обучающие данные редко сочетают такие сцены с плотной разметкой и редко меняют их управляемым образом.

Для этого представлена DeskForge, управляемая среда рабочего стола, которая собирает из реальных приложений сцены и исследует их, порождая крупномасштабную обучающую разметку. Среда варьирует состояния приложений, содержимое, раскладку окон, внешний вид и разрешение. Она объединяет скриншоты, деревья доступности (accessibility trees) и геометрию окон в плотную разметку элементов и при этом записывает исход каждого выполненного действия.

На основе среды построен корпус DeskForge-1M: 1,2 млн размеченных наблюдений рабочего стола (снимков экрана с разметкой), содержащих 159,7 млн экземпляров элементов. Четыре vision-language модели (модели, работающие с изображением и текстом) дообучили на 200 тыс. примеров привязки к элементам интерфейса (grounding), взятых из DeskForge-1M.

По данным авторов, все четыре модели улучшились в отложенных условиях рабочего стола и на всех пяти внешних тестах привязки к элементам интерфейса. Для Qwen3.5-4B точность выросла на 11,51 процентного пункта на ScreenSpot-Pro и на 10,11 пункта на OSWorld-G.

Прирост сказался и на выполнении длинных задач. При фиксированном планировщике дообученные модели решают больше задач в WebArena-Infinity и OpenApps: Qwen3.5-4B поднялась с 31 до 50 из 119 задач и с 3 до 15 из 100 задач соответственно. Авторы делают вывод, что управляемая сборка реальных настольных сред, масштабируемый источник обучающего сигнала и для привязки к элементам интерфейса, и для долгой работы за компьютером. Код фреймворка, набор данных и дообученная модель доступны на странице проекта.

Ключевые факты

  • DeskForge, управляемая среда, которая собирает реальные приложения и варьирует состояния, содержимое, раскладку окон, внешний вид и разрешение.
  • Корпус DeskForge-1M: 1,2 млн размеченных наблюдений рабочего стола и 159,7 млн экземпляров элементов.
  • Четыре модели дообучили на 200 тыс. примеров привязки к элементам интерфейса; все улучшились на пяти внешних тестах.
  • Для Qwen3.5-4B: +11,51 п.п. на ScreenSpot-Pro и +10,11 пункта на OSWorld-G.
  • При фиксированном планировщике Qwen3.5-4B решает 50 из 119 задач WebArena-Infinity (было 31) и 15 из 100 задач OpenApps (было 3).

Почему это важно

Агентам, управляющим компьютером, сложно находить нужный элемент среди перекрывающихся окон и похожих кнопок, а подходящих обучающих данных с плотной разметкой мало. DeskForge предлагает не собирать такие данные вручную, а порождать их из реальных приложений, управляемо меняя условия сцены. Заметный прирост у небольшой модели Qwen3.5-4B, в том числе в длинных задачах, показывает, что такой подход даёт практический эффект.

Кому это важно

Исследователям и командам, которые обучают агентов, работающих с графическим интерфейсом, и ищут масштабируемые источники обучающих данных. Также тем, кто сравнивает модели на тестах привязки к элементам интерфейса (ScreenSpot-Pro, OSWorld-G) и на задачах WebArena-Infinity и OpenApps.

Как это применить

По заявлению авторов, код фреймворка, набор данных и дообученная модель доступны на странице проекта (saidgurbuz.github.io/deskforge). Можно взять корпус DeskForge-1M или 200 тыс. примеров привязки к элементам, чтобы дообучить собственную vision-language модель, либо воспроизвести сборку данных своей средой. Условия лицензии, затраты вычислений и время обучения в источнике не указаны.

Можно ли доверять

Это аннотация научной статьи, все результаты заявлены самими авторами. Независимой проверки в источнике нет. Названа только модель Qwen3.5-4B; остальные три модели не названы, а прирост для них не приведён. Не указаны и исходные значения точности на ScreenSpot-Pro и OSWorld-G, только прирост в пунктах, поэтому оценить итоговый уровень по аннотации нельзя. Фиксированный планировщик тоже не назван.

Риски и подводные камни

Из аннотации не видно, какие именно приложения собирает DeskForge, поэтому охват сред остаётся неясным. Результаты по долгим задачам приведены лишь для Qwen3.5-4B и двух наборов задач (119 и 100 задач), так что делать широкие выводы рано. Неизвестно также, какая из четырёх моделей выложена как дообученная.

«Эти результаты показывают, что управляемая сборка реальных настольных сред даёт масштабируемый источник обучающего сигнала для улучшения как привязки к элементам интерфейса, так и долгой работы за компьютером.»

— из аннотации статьи DeskForge