LightNav-0: VLM для навигации роботов показала SOTA на 10 бенчмарках

Исследователи представили LightNav-0, компактную универсальную модель для навигации роботов, построенную поверх предобученной визуально-языковой модели (VLM). Идея в том, что современные VLM уже содержат пространственные знания, понимание сцены, пространственное рассуждение, способность указывать на объекты (pointing), но эти способности почти никогда не используются напрямую для управления роботом: существующие навигационные системы вместо этого собираются из компонентов под конкретную задачу и конкретного робота, из-за чего восприятие, рассуждение и действие оказываются разделены, а система плохо переносится на новые условия. LightNav-0 устраняет это разделение: он извлекает пространственный интеллект уже обученной VLM и напрямую связывает его с навигацией, без отдельных «голов» предсказания под конкретные задачи.
Для этого разные виды навигационных задач сведены к единому интерфейсу токенов. Двухканальное указание точек (pointing) выражает, куда и зачем должен двигаться робот, независимо от конкретной задачи, сцены или типа робота, а отдельный остаточный векторно-квантованный токенизатор действий переводит это намерение в точную траекторию движения, привязанную уже к конкретному роботу. Модель также сжимает историю визуальных наблюдений с учётом времени. Обучение состоит из нескольких этапов: промежуточное обучение на задачах воплощённого рассуждения (embodied reasoning, ER), затем контролируемая дообучающая настройка и обучение с подкреплением. Всё вместе это позволяет одной модели следовать инструкциям, искать объекты по открытому словарю названий (без заранее заданного списка целей) и вести визуальное отслеживание цели. Обучающий корпус охватывает более 2 тысяч сцен и свыше 4 тысяч часов данных о навигации роботов.
По заявлению авторов, промежуточная версия LightNav-ER, на основе которой инициализирован LightNav-0, показала наивысший средний результат по полному набору из 8 бенчмарков воплощённого рассуждения, а сам LightNav-0 достиг наилучших результатов (state-of-the-art) по доле успешных монокулярных попыток навигации сразу на всех 10 публичных симуляционных бенчмарках. В реальных экспериментах с физическими роботами модель дополнительно показала перенос без дополнительного обучения (zero-shot) на разные типы роботов, разные сцены и как на неподвижные, так и на движущиеся цели. Авторы делают вывод, что компактные VLM могут служить единой и переносимой базовой моделью для универсальной навигации роботов.
Ключевые факты
- LightNav-0, компактная модель навигации роботов, построенная на предобученной VLM, без отдельных модулей под конкретные задачи
- Единый интерфейс токенов: двухканальное указание точек задаёт пространственное намерение, остаточный векторно-квантованный токенизатор превращает его в траекторию под конкретного робота
- Обучающий корпус: более 2 тысяч сцен и свыше 4 тысяч часов данных о навигации
- Промежуточная версия LightNav-ER показала наивысший средний результат по 8 бенчмаркам воплощённого рассуждения; LightNav-0, state-of-the-art по 10 из 10 публичных навигационных симуляций
- В реальных экспериментах модель без дополнительного обучения перенеслась на новые типы роботов, сцены и подвижные цели
Почему это важно
Современные визуально-языковые модели уже неплохо понимают пространство, умеют находить объекты на изображении, рассуждать об их взаимном расположении и указывать на них, но в робототехнике эти способности почти не используются напрямую. Вместо этого системы навигации собирают из отдельных модулей под конкретную задачу и конкретного робота, из-за чего восприятие, рассуждение и управление оказываются разорваны, а перенос на новые условия ограничен. LightNav-0 показывает, что пространственный интеллект VLM можно подключить к навигации напрямую, одной моделью, без специализированных «голов» под каждую задачу.
Кому это важно
Прежде всего, исследователям и разработчикам воплощённого ИИ (embodied AI) и робототехники, которые строят системы навигации для мобильных роботов и других автономных агентов: подход снижает потребность в отдельной инженерии под каждый тип задачи и робота и опирается на уже существующие предобученные VLM.
Как это применить
LightNav-0 сводит разные навигационные задачи, следование инструкциям, поиск объекта по открытому названию, визуальное отслеживание цели, к единому интерфейсу токенов: двухканальное указание точек описывает пространственное намерение независимо от задачи и типа робота, а отдельный токенизатор действий переводит это намерение в траекторию, учитывающую конкретную конструкцию робота. Обучение построено в несколько этапов, промежуточное обучение на задачах воплощённого рассуждения, затем контролируемая настройка и обучение с подкреплением, на корпусе из более чем 2 тысяч сцен и свыше 4 тысяч часов данных. В источнике не указаны сроки релиза модели и доступность кода или весов.
Можно ли доверять
Материал, научная публикация, размещённая на площадке препринтов Hugging Face Papers; все цифры и оценки в пересказе исходят от самих авторов и пока не подтверждены независимо. Источник называет только сравнительные и превосходные оценки, «наивысший результат», «state-of-the-art», но не приводит конкретных процентов успешности или очков по бенчмаркам и не называет модели-конкуренты, с которыми проводилось сравнение, так что судить о величине разрыва по опубликованному тексту нельзя.
Риски и подводные камни
В открытом тексте не раскрыты ни конкретные показатели успешности, ни то, какие именно роботы использовались в реальных экспериментах, ни то, планируется ли публикация кода или весов модели. Без этих деталей независимо проверить масштаб заявленного улучшения и воспроизвести результаты пока невозможно.