AnTrap выявил уязвимость ИИ-агентов для Android к сбоям

Исследователи представили бенчмарк AnTrap, систему, которая намеренно вносит динамические помехи в процесс выполнения задач ИИ-агентами, управляющими интерфейсом Android. Авторы отмечают: на практике такие агенты регулярно сталкиваются с непредвиденными сбоями, от всплывающих окон до ошибочного выполнения действий, но существующие бенчмарки не проверяют устойчивость агентов к подобным помехам системно.
Для AnTrap предложена таксономия, которая делит реальные аномалии на четыре уровня, состояние (State), рассуждение (Thinking), действие (Action) и раунд/цикл (Round), и десять более мелких подкатегорий внутри них. Разработан отдельный конвейер построения тестовых сценариев: он добавляет реалистичные состязательные условия, но сохраняет принципиальную решаемость задачи, агент теоретически по-прежнему может её выполнить, просто ему мешают.
На бенчмарке протестировали 16 ведущих GUI-моделей и обнаружили всеобщую уязвимость к динамическим аномалиям: даже самые сильные модели заметно теряют в качестве работы при столкновении с помехами. Конкретные числовые показатели деградации по отдельным моделям в тексте не приводятся.
Чтобы понять, устранима ли эта уязвимость обучением, авторы дополнительно провели обучение методом GRPO (Group Relative Policy Optimization) как в обычной, так и в состязательной среде. Результат разделил проблемы на два типа. Одношаговые ловушки на уровне состояния и действия в основном поддаются исправлению за счёт состязательного обучения с подкреплением. А глубокие контекстные ловушки, например, тупик состояния (state deadlock), когда агент застревает в замкнутом цикле, вскрывают более фундаментальные ограничения моделей, которые одним лишь обучением в среде с ловушками не исправить.
Ключевые факты
- Бенчмарк AnTrap вносит динамические помехи, всплывающие окна, ошибочные действия и другие сбои, в трассы выполнения задач ИИ-агентами на Android.
- Таксономия аномалий охватывает четыре уровня (состояние, рассуждение, действие, раунд) и десять более мелких подкатегорий.
- На бенчмарке проверили 16 ведущих GUI-моделей: у всех обнаружена уязвимость, даже сильнейшие модели заметно теряют в качестве работы.
- Дополнительное обучение методом GRPO в обычной и состязательной средах показало: одношаговые ловушки на уровне состояния и действия обучение устраняет, а глубокие контекстные ловушки вроде тупика состояния, нет.
- Точные числовые показатели деградации по каждой модели, состав авторов, организации и место публикации в тексте не указаны.
Почему это важно
Существующие бенчмарки для GUI-агентов долгое время не проверяли устойчивость моделей к реальным сбоям среды, они оценивали, справляется ли агент с задачей в идеальных условиях, а не с тем, что происходит, когда интерфейс ведёт себя непредсказуемо. AnTrap закрывает именно этот пробел и показывает, что запас прочности у нынешних моделей заметно ниже, чем можно было предположить по чистым тестам.
Кому это важно
Разработчикам ИИ-агентов, автоматизирующих действия на Android-устройствах, от мобильных ассистентов до систем автотестирования приложений. Важно это и исследователям, которые занимаются устойчивостью и обучением с подкреплением: работа даёт конкретную таксономию сбоев и метод их эмуляции для тренировки моделей.
Как это применить
AnTrap можно использовать как проверочный стенд перед выводом GUI-агента в реальную эксплуатацию, прогнать его через все четыре слоя аномалий и увидеть, где он ломается. Там, где сбои одношаговые (реакция на всплывающее окно, ошибочное действие), помогает состязательное дообучение вроде GRPO. Для глубоких контекстных ловушек такого простого рецепта пока нет, их нужно закладывать в архитектуру рассуждений агента отдельно.
Можно ли доверять
Источник, научная публикация, представленная на Hugging Face Papers, с чётко описанной методологией: таксономией сбоев, конвейером их генерации и оценкой на 16 моделях. При этом в доступном тексте не названы авторские организации, полный список авторов, издание или дата публикации, а также отсутствуют точные цифры деградации по каждой отдельной модели, для полной проверки стоит смотреть саму статью.
Риски и подводные камни
Главный тревожный вывод работы, не все виды уязвимости лечатся дополнительным обучением: глубокие контекстные ловушки вроде тупика состояния остаются нерешённой проблемой даже после состязательной тренировки. Это значит, что развёртывание GUI-агентов на реальных Android-устройствах без учёта таких сценариев несёт риск непредсказуемых сбоев в продакшене.