Веб-агент WebFovea занял 2-е место в WebRetriever Challenge 2026: ошибки сидели в обвязке, а не в модели

WebFovea, веб-агент, который «смотрит» на страницу как человек, то есть работает со зрительным представлением сайта. В соревновании WebRetriever Challenge 2026 он занял 2-е место с итоговым результатом 57,0 балла из 100. Задача в соревновании такая: агент получает адрес входной страницы живого сайта, должен сам пользоваться интерфейсом этого сайта и вернуть проверяемый ответ. Оценка идёт «от начала до конца» по протоколу III бенчмарка WebRetriever (arXiv:2607.06118).
Главный тезис авторов: мощная мультимодальная большая языковая модель для такой задачи необходима, но недостаточна. Решения модели попадают в браузер через обвязку (harness), код между моделью и страницей. На каждом шаге должны сработать четыре вещи: ответ модели разбирается в задуманное действие; действие действительно выполняется на странице; результат точно возвращается модели; модели показывают нужную ей информацию. По наблюдениям авторов, на реальных сайтах многие сбои происходили на одном из этих четырёх этапов, а не в рассуждениях модели.
Примеры таких сбоев из аннотации: несовпадение систем координат ставило каждый клик на 3/4 от задуманных координат; действия на встроенных выпадающих списках, внутри iframe и в текстовых полях молча не срабатывали; а сгенерированные самой моделью служебные токены шаблона чата попадали в 4,9% эпизодов выполнения задач и портили их.
WebFovea усиливает каждый из четырёх этапов и окружает цикл работы ограничителями, которые удерживают агента в рамках правил и бюджета. По словам авторов, взгляд через четыре этапа не зависит от модели, хотя некоторые отдельные исправления от неё зависят.
Во всех четырёх официальных отправках использовалась одна и та же модель, поэтому рост балла на скрытом наборе с 31,0 до 57,0, как пишут авторы, отражает изменения обвязки, с поправкой на разброс между запусками на живых сайтах. В статье описаны устройство агента, доказательства для каждого компонента (включая отрицательные результаты), разбор ошибок, ограничения и дорожная карта, куда входит направление разных шагов к разным моделям. Код опубликован на GitHub: github.com/jianganghan/WebFovea.
Ключевые факты
- WebFovea, агент, работающий с живыми сайтами по визуальной информации; занял 2-е место в WebRetriever Challenge 2026 с результатом 57,0 из 100.
- Официальный балл на скрытом наборе вырос с 31,0 до 57,0 за четыре отправки при одной и той же модели; авторы связывают рост с изменениями обвязки.
- Примеры сбоев обвязки: из-за несовпадения систем координат клики попадали на 3/4 от задуманных координат; действия в выпадающих списках, iframe и текстовых полях молча не срабатывали.
- Служебные токены шаблона чата, сгенерированные самой моделью, портили 4,9% эпизодов выполнения задач.
- Код проекта опубликован на GitHub; в статье есть и отрицательные результаты, разбор ошибок и ограничения.
Почему это важно
Агенты, которые сами кликают по сайтам, обычно обсуждают через призму качества модели. Эта работа показывает другую сторону: по наблюдениям авторов, многие провалы на живых сайтах случаются не в рассуждениях, а в передаче решения в браузер и обратно. Та же модель при исправленной обвязке дала рост с 31,0 до 57,0 балла, то есть почти вдвое.
Кому это важно
Разработчикам веб-агентов и систем автоматизации браузера, командам, которые тестируют агентов на живых сайтах, и тем, кто сравнивает агентов по результатам бенчмарков: итоговый балл зависит не только от модели, но и от обвязки вокруг неё.
Как это применить
Из аннотации следует практический перечень проверок: правильно ли разобран ответ модели, сработало ли действие на странице (особенно в выпадающих списках, iframe и текстовых полях), точно ли результат возвращается модели, показана ли ей нужная информация. Отдельно стоит проверять согласованность систем координат кликов и очищать вывод от служебных токенов шаблона чата. Код проекта доступен на GitHub (github.com/jianganghan/WebFovea).
Можно ли доверять
Это текст самих авторов (аннотация статьи), результат подтверждён местом в соревновании и открытым кодом. Рост балла авторы честно оговаривают: он получен с поправкой на разброс между запусками на живых сайтах, величина которого не названа. Какая именно мультимодальная модель использовалась, сколько команд участвовало и какой балл у победителя, в аннотации не указано. Вклад отдельных исправлений в рост балла там также не раскрыт.
Риски и подводные камни
Слово «многие» в тезисе о сбоях обвязки не подкреплено долей от всех ошибок. Авторы сами отмечают, что взгляд через четыре этапа не зависит от модели, а часть отдельных исправлений зависит. Результаты получены на живых сайтах, где повторяемость ограничена, поэтому разброс между запусками нужно учитывать при сравнении. Подробности отрицательных экспериментов и ограничений нужно смотреть в полном тексте статьи.
«Мощная мультимодальная большая языковая модель для этого необходима, но недостаточна.»
— Авторы WebFovea, аннотация статьи