ReferTrack: метод научил робота следить за целью по камере

Задача, которую решают авторы, embodied visual tracking (EVT, «визуальное слежение воплощённого агента за целью»): мобильный робот должен непрерывно следовать за конкретной целью, описанной обычным языком, опираясь только на одну бортовую камеру, без лидаров, дополнительных сенсоров или нескольких камер. Современные модели класса vision-language-action (VLA, «зрение, язык, действие»), которые одновременно решают, что считать целью, и как к ней двигаться, обычно рассуждают об этом «про себя», через цепочку рассуждений (chain-of-thought, CoT), скрытую в абстрактных внутренних представлениях. Эти представления трудно проверить, и они слабо привязаны к тому, что робот реально распознаёт на кадре: по сути, непонятно, на какой именно видимый объект опирается решение модели.
Авторы (Hanjing Ye с соавторами) предлагают ReferTrack, метод по принципу «сначала распознать цель, потом следить за ней» (referring-then-tracking). Сначала модель выбирает нужную цель из набора размеченных на кадре рамок-кандидатов (bounding box), то есть явно указывает, какой из видимых объектов является целью. И только затем, опираясь именно на этот выбор, строит траекторию слежения (путевые точки) для движения робота. Такое разделение делает рассуждение проверяемым: видно, какую именно рамку на кадре модель считает целью, а не только абстрактный внутренний вектор.
Чтобы не терять цель при её перемещении, ReferTrack хранит скользящее окно из ранее выбранных рамок и добавляет их геометрические признаки (позицию и размер) в историю кадров через специальные токены TVBI (temporal-viewpoint-bbox indicator, «индикатор времени, ракурса и рамки»). Это помогает модели связывать текущее обнаружение цели с её положением на предыдущих кадрах, даже если цель на время пропадала из виду или сцена менялась. Для более точного выбора цели по словесному описанию, особенно когда в кадре есть похожие объекты или формулировка неоднозначна, модель дополнительно обучили на собственном наборе данных Refer-QA.
На бенчмарке EVT-Bench ReferTrack показал наилучший результат среди систем с одной камерой (single-view): 89,4% успешных попыток на простых сценах с одной чёткой целью, 73,3%, на сценах с отвлекающими похожими объектами и 74,1%, при неоднозначных словесных описаниях цели. В задачах, где решающую роль играет точная идентификация цели, ReferTrack сравнялся или даже обошёл несколько моделей сравнения, использующих сразу несколько камер.
Работоспособность метода проверили не только в симуляции, но и на реальных роботах, шагающих и человекоподобных (гуманоидных): по данным авторов, перенос из симуляции в реальность (sim-to-real) прошёл устойчиво. Код ReferTrack авторы выложили в открытый доступ на GitHub (MedlarTea/referTrack).
Ключевые факты
- ReferTrack сначала явно выбирает рамку-цель среди кандидатов на кадре с одной камеры и только затем строит по этому выбору траекторию слежения, в отличие от моделей, где это решение скрыто в абстрактных внутренних представлениях.
- Чтобы не терять цель при движении, метод хранит скользящее окно ранее выбранных рамок и кодирует их через токены TVBI, а для точного выбора цели по описанию дообучен на собственном наборе данных Refer-QA.
- На бенчмарке EVT-Bench результат, 89,4% успеха с одной чёткой целью, 73,3% с отвлекающими объектами и 74,1% при неоднозначном описании, SOTA среди систем с одной камерой.
- На задачах, где решает точная идентификация цели, ReferTrack сравнялся или обошёл несколько моделей сравнения, использующих сразу несколько камер.
- Метод проверен не только в симуляции, но и на реальных шагающих и человекоподобных роботах; код выложен в открытом доступе на GitHub.
Почему это важно
Роботу, который должен «найти и не потерять» цель по словесному описанию, используя только одну камеру, обычно приходится полагаться на VLA-модели, где рассуждение о том, что считать целью, спрятано в абстрактных внутренних представлениях, это трудно проверить и трудно отладить, если робот вдруг начинает следовать не за тем объектом. ReferTrack явно разделяет два шага, «какая рамка на кадре является целью» и «как к ней двигаться», и привязывает решение к конкретному, видимому обнаружению на изображении, а не к скрытому вектору. По цифрам из EVT-Bench это разделение не только упрощает проверку, но и даёт лучший результат среди систем с одной камерой, местами обгоняя мультикамерные решения.
Кому это важно
В первую очередь, разработчикам мобильных, шагающих и человекоподобных роботов, которым нужно, чтобы робот следовал за человеком или объектом по словесной команде, но без дорогого мультикамерного оснащения: одна камера дешевле, легче и проще в интеграции, что особенно важно для дронов, четвероногих роботов и гуманоидов, где каждый лишний сенсор, это вес и энергопотребление. Во вторую, исследователям vision-language-action моделей и «воплощённого» ИИ (embodied AI), которым интересен сам принцип «сначала явно распознать цель, потом строить траекторию» как способ сделать рассуждение модели проверяемым.
Как это применить
Авторы выложили код в открытом доступе на GitHub (MedlarTea/referTrack), так что реализацию можно изучить и переиспользовать напрямую. Практически метод собирается из трёх частей: детектор рамок-кандидатов на кадре с камеры, шаг выбора нужной рамки по словесному описанию цели (с учётом истории через TVBI-токены и скользящее окно) и декодер, который превращает этот выбор в путевые точки для контроллера движения робота. Поскольку авторы уже показали устойчивый перенос из симуляции в реальность, разумный путь внедрения, сначала обучение и отладка в симуляции на своей платформе, затем перенос на реального робота.
Можно ли доверять
В пользу доверия, конкретные количественные результаты на именованном бенчмарке (EVT-Bench, три сценария) и проверка не только в симуляции, но и на реальных шагающих и человекоподобных роботах, плюс открытый код на GitHub, который можно перепроверить. Ограничение, это исследовательская публикация (раздел Hugging Face Papers), и по доступному тексту нельзя судить о независимом рецензировании, деталях сборки датасета Refer-QA или о полном протоколе сравнения с базовыми решениями за пределами приведённых процентов.
Риски и подводные камни
Даже в самом простом сценарии, с одной чёткой, однозначной целью, метод ошибается примерно в одном случае из десяти (89,4% успеха); при появлении похожих отвлекающих объектов или неоднозначном описании цели точность падает до 73, 74%, а это как раз частые условия реальной среды, а не лаборатории. Робот полагается только на одну камеру без резервных сенсоров, поэтому слепые зоны или перекрытие цели другим объектом могут сорвать слежение. В тексте не приводятся данные о вычислительных затратах, задержке в реальном времени, стоимости сборки датасета Refer-QA и поведении метода вне протестированных типов роботов (шагающие и гуманоидные), так что применимость к другим платформам и более людным сценам пока не подтверждена.