Бенчмарк EASEL показал: ИИ-агенты не справляются с точным визуальным управлением инструментами

Оценка ИИ-моделей смещается от статичных вопросов-ответов к агентным сценариям, где модель действует через внешние инструменты. Исследователи выделяют недоисследованную способность, «ловкое визуальное использование инструментов»: точное, замкнутое по обратной связи параметризованное визуальное действие, при котором модель считывает параметры инструмента по визуальным данным, и от точности этих параметров напрямую зависит итоговый результат. Существующие бенчмарки проверяют навигацию по вебу, работу с графическим интерфейсом и разработку ПО, но почти не затрагивают именно эту связку «визуальные данные → точность исполнения».
Чтобы закрыть этот пробел, авторы предложили бенчмарк EASEL. Его основная задача, агент по шагам закрашивает холст, стараясь воспроизвести эталонное изображение (реконструкция по образцу). Помимо этого EASEL включает смысловые задачи: разметку областей на изображении, рукописный текст и планирование пути. Вместе с бенчмарком выпущен EASEL-Data, датасет для обучения по траектории на 440 тысяч примеров с двухэтапной учебной программой, и на нём обучена модель EASEL-9B, чтобы проверить, как такое обучение влияет на способность.
Оценка 25 моделей показала, что современные мультимодальные агенты системно не справляются с задачами EASEL. Сходство нарисованного с эталоном упирается в низкий потолок, от 0,40 до 0,54. Диагностика по шагам траектории вскрывает серьёзную неустойчивость при работе в замкнутом цикле: модели, как правило, рано выходят на плато или, достигнув пика, затем ухудшают результат. Смысловые задачи, точная разметка и планирование пути, обнажают резкие границы возможностей моделей. EASEL-9B, обученная на EASEL-Data, обошла свою базовую модель на 6,3% (относительный прирост) и заняла третье место среди всех оценённых моделей; какая модель была базовой и какие модели заняли первые два места, в источнике не указано.
Ключевые факты
- Бенчмарк EASEL: агент по шагам закрашивает холст, воспроизводя эталонное изображение (основная задача, реконструкция по образцу), плюс смысловые задачи, разметка областей, рукописный текст, планирование пути
- Оценка 25 мультимодальных ИИ-моделей: сходство восстановленного изображения с эталоном упирается в потолок 0,40, 0,54
- Диагностика траекторий: модели рано выходят на плато или деградируют после пика, сильная неустойчивость в замкнутом цикле обратной связи
- Выпущен датасет EASEL-Data на 440 тысяч примеров с двухэтапной учебной программой для обучения агентов по траектории
- Модель EASEL-9B, обученная на EASEL-Data, обошла базовую модель на 6,3% (относительный прирост) и заняла 3-е место среди всех протестированных моделей
Почему это важно
Работа называет конкретный пробел в том, как сегодня проверяют ИИ-агентов: тесты на навигацию по вебу, работу с интерфейсами и код почти не проверяют, умеет ли модель точно считывать параметры действия из картинки и тут же, в замкнутом цикле, исполнять их, а именно это нужно для любой задачи, где модель должна не просто описать изображение, а физически или виртуально что-то на нём сделать с нужной точностью. EASEL нацелен на то, чтобы измерить именно эту способность отдельно от смежных навыков.
Кому это важно
Разработчикам мультимодальных агентов и командам, которые строят системы с визуальной обратной связью, от графических и дизайнерских ассистентов до роботизированных манипуляторов и агентов, управляющих графическим интерфейсом по скриншотам. Также полезно исследователям, которые создают бенчмарки для агентных ИИ-систем.
Как это применить
EASEL можно использовать как отдельный тест для оценки моделей на точное визуальное управление инструментами, стандартные бенчмарки эту связку почти не проверяют. Датасет EASEL-Data (440 тысяч примеров, двухэтапная учебная программа) можно применять для целевого дообучения агентов: авторы показывают, что обучение на нём подняло результат модели EASEL-9B на 6,3% относительно базовой версии.
Можно ли доверять
Материал, полноценное описание бенчмарка с систематической оценкой 25 моделей, а не единичный анекдот, и цифры (диапазон сходства 0,40, 0,54, прирост EASEL-9B на 6,3%) приведены как измеренные результаты. При этом в доступном тексте не названы авторы, их организации, дата публикации или площадка, а также не указано, какая модель служила базовой для EASEL-9B и какие модели заняли первые два места, эти детали проверить по имеющемуся источнику нельзя.
Риски и подводные камни
Задача «закрасить холст по образцу», упрощённый полигон, и неизвестно, насколько результаты переносятся на реальные визуальные инструменты вне бенчмарка. Прирост EASEL-9B в 6,3%, относительный и от неназванной базовой модели, то есть абсолютный уровень качества по-прежнему низкий (сходство не выше 0,54 у всех моделей). Также не сообщается, доступны ли код, датасет и веса модели публично и на каких условиях, без этого независимая проверка результатов затруднена.