Представлен EgoTools: датасет и бенчмарк по работе с инструментами в видео от первого лица

Представлен EgoTools: датасет и бенчмарк по работе с инструментами в видео от первого лица

В статье на Hugging Face Papers представлен EgoTools, как утверждают авторы, первый комплексный набор для понимания использования инструментов в видео от первого лица. Исходная мысль такая: реальные задачи, от бытовых до профессиональных, во многом строятся вокруг инструментов, а чтобы их понимать, нужно рассуждать о том, как инструмент можно использовать (affordances), о геометрии «рука, инструмент, объект», о ходе процедуры и о причинных последствиях для обрабатываемого предмета. При этом современные мультимодальные видеомодели, по словам авторов, хороши в задачах на восприятие (подписи к видео, общие вопросы по видео), но ограничены именно в таком «инструментальном» рассуждении. Причину авторы видят в нехватке реальных данных от первого лица и диагностических бенчмарков.

EgoTools состоит из двух частей. EgoTools-Data, корпус из 100 часов записей от первого лица, сосредоточенных на инструментах, с синхронным звуком, плотными подписями, насыщенными рассуждениями описаниями действий и дополнительной 3D-информацией. EgoTools-Bench, диагностический бенчмарк из 1000 пар «вопрос, ответ», разделённых на четыре направления: от восприятия и геометрии до процедуры и причинных связей.

Результаты проверки: модели по-прежнему плохо привязывают использование инструментов к визуальным свидетельствам. Gemini-3.1-Pro показывает 66,9% общей точности, но только 51,7% на направлении Perception & Grounding (восприятие и привязка к кадру).

Отдельно авторы проверили EgoTools-Data как обучающий материал. На полном бенчмарке из 1000 вопросов полное обучение с учителем (supervised fine-tuning) поднимает результат Qwen3-VL-8B-Instruct с 50,0% до 60,9%; по словам авторов, при строгом разделении исходных видео между обучением и проверкой. Итог: EgoTools предлагается как единый ресурс и для обучения, и для диагностической оценки понимания работы с инструментами в реальном видео от первого лица.

Ключевые факты

  • EgoTools состоит из двух частей: EgoTools-Data (100 часов записей от первого лица с синхронным звуком, плотными подписями, описаниями действий с рассуждениями и дополнительной 3D-информацией) и EgoTools-Bench (1000 вопросов в четырёх направлениях).
  • Gemini-3.1-Pro набирает 66,9% общей точности на EgoTools-Bench, но только 51,7% на направлении Perception & Grounding.
  • Полное обучение с учителем на EgoTools-Data поднимает результат Qwen3-VL-8B-Instruct на полном бенчмарке с 50,0% до 60,9% при строгом разделении исходных видео.
  • Авторы заключают, что современные видеомодели сильны в подписях и общих вопросах по видео, но ограничены в рассуждениях об использовании инструментов.

Почему это важно

Многие бытовые и профессиональные действия, это работа с инструментами, и агентам, которые должны действовать в физическом мире, нужно понимать, как устроено взаимодействие руки, инструмента и объекта и к чему оно приводит. По словам авторов, прогресс упирался в нехватку реальных данных от первого лица и диагностических бенчмарков. EgoTools заявлен как первый комплексный набор такого рода: и данные для обучения, и тест, который показывает, где именно модели слабы.

Кому это важно

Исследователям мультимодальных видеомоделей и робототехники, которым нужны данные и метрика для оценки понимания действий с инструментами. Также командам, которые разрабатывают ассистентов и агентов для физических задач и хотят видеть слабые места моделей, например привязку ответов к тому, что реально видно в кадре.

Как это применить

Источник описывает EgoTools как ресурс для двух целей: обучение (EgoTools-Data) и диагностическая оценка (EgoTools-Bench). Пример из статьи: полное дообучение Qwen3-VL-8B-Instruct на EgoTools-Data подняло результат на бенчмарке с 50,0% до 60,9%. Сведений о лицензии, дате выпуска и способе скачивания в тексте аннотации нет.

Можно ли доверять

Все цифры взяты из аннотации статьи и представляют собственные заявления авторов; независимой проверки в материале нет. Заявление о «первом комплексном наборе» тоже принадлежит авторам. Авторы подчёркивают, что прирост после дообучения получен при строгом разделении исходных видео, то есть видео из обучения не попадают в проверку. Из текста аннотации нельзя узнать, как собирались записи и какие инструменты и профессии они охватывают.

Риски и подводные камни

Это только аннотация: в ней приведены результаты лишь двух моделей, Gemini-3.1-Pro и Qwen3-VL-8B-Instruct. Названия остальных трёх направлений бенчмарка и оценки Gemini-3.1-Pro по ним не указаны, поэтому широкие выводы о всех моделях делать рано. Для 50,0% и 60,9% не уточнено, что это именно точность, а подробности дообучения (параметры, вычислительные ресурсы, частичные варианты) не приводятся.

«Современные модели по-прежнему плохо привязывают использование инструментов к визуальным свидетельствам.»

— из аннотации статьи об EgoTools