Qwen-Drive-1.0: новая модель объединила 3D-восприятие и планирование для беспилотных авто

Авторы представили Qwen-Drive-1.0, по их описанию, первый шаг к созданию визуально-языковой (vision-language) базовой модели для автономного вождения. Модель сохраняет архитектуру предобученной визуально-языковой модели (VLM) и объединяет в единой системе три задачи: 3D-восприятие сцены, ответы на вопросы по изображению (visual question answering) и планирование движения автомобиля.
За восприятие 3D-сцены отвечает отдельный модуль, «голова» восприятия вида сверху (bird's-eye-view, BEV). Она одновременно решает три задачи: обнаруживает объекты в 3D, предсказывает семантическую занятость пространства (какие участки сцены заняты и чем) и сегментирует карту сцены с высоты птичьего полёта. По словам авторов, этот модуль служит проверкой того, какая 3D-информация вообще доступна из общих представлений модели, и даёт явный, проверяемый интерфейс к структуре 3D-сцены.
За планирование движения отвечает отдельный компонент, Planning Expert («эксперт по планированию»). Он опирается на те же общие представления VLM, что и остальная модель, и на их основе строит будущую траекторию движения автомобиля.
Модель обучают в несколько этапов: обучение на данных вождения совмещают с обучением на данных общего назначения для визуально-языковых моделей. Так модель приобретает специфичные для вождения навыки, но при этом старается сохранить широкие способности понимания изображений и следования инструкциям, характерные для исходной VLM.
По утверждению авторов, эксперименты показывают сильные результаты в 3D-восприятии и понимании дорожной сцены при значительном сохранении общих визуально-языковых способностей модели. Всесторонняя проверка в трёх режимах, open-loop, псевдо-closed-loop и closed-loop (различаются тем, насколько собственные решения модели влияют на дальнейшую траекторию при тестировании), показала, по словам авторов, «высококонкурентоспособные» результаты в планировании движения. Конкретные числовые показатели, тестовые бенчмарки, размер модели, объём и состав обучающих данных, исходная базовая VLM, организация-разработчик и планы по выпуску кода или весов модели в источнике не указаны.
Ключевые факты
- Qwen-Drive-1.0, визуально-языковая модель, объединяющая в одной архитектуре 3D-восприятие сцены, ответы на вопросы по изображению и планирование движения автомобиля.
- Отдельный BEV-модуль восприятия одновременно решает 3D-детекцию объектов, предсказание занятости пространства и сегментацию карты сцены сверху.
- Компонент Planning Expert строит будущую траекторию автомобиля на основе общих представлений визуально-языковой модели.
- Обучение проходит в несколько этапов: данные вождения совмещаются с общими vision-language данными, чтобы модель не теряла базовые способности понимания изображений.
- По заявлению авторов, модель показывает конкурентоспособные результаты в open-loop, псевдо-closed-loop и closed-loop тестах планирования; при этом числовые показатели, база модели, объём данных и организация-разработчик в источнике не раскрыты.
Почему это важно
Работа, попытка собрать в одной модели то, что в автономном вождении обычно решают разными системами: восприятие 3D-сцены, понимание происходящего на изображении и планирование маршрута. Идея «базовой модели для вождения» на основе визуально-языковой архитектуры, часть более широкого исследовательского направления, где для беспилотных систем пробуют использовать общие VLM вместо узких специализированных модулей. Здесь это сделано так, что 3D-восприятие остаётся отдельным проверяемым модулем (BEV-голова), а не «чёрным ящиком» внутри общей модели.
Кому это важно
Прежде всего, исследователям и инженерам, которые занимаются автономным вождением и визуально-языковыми моделями: архитектура объединения 3D-восприятия, VQA и планирования в одной VLM, предмет их профильного интереса. Также интересно тем, кто исследует, как обучать модель на новую узкую задачу (вождение), не теряя её общих способностей, эта проблема актуальна далеко за пределами автомобильной темы.
Как это применить
В источнике нет данных о выпуске кода, весов модели или сроках релиза, это исследовательская работа, описывающая архитектуру и подход, а не готовый к использованию продукт. Применить модель на практике сейчас нельзя: неизвестны ни размер модели, ни объём и состав обучающих данных, ни то, какая VLM взята за основу.
Можно ли доверять
Все утверждения о результатах, сильное 3D-восприятие, сохранение общих способностей, «высококонкурентоспособное» планирование, принадлежат самим авторам и не подкреплены в источнике ни одной цифрой, ни ссылкой на конкретный бенчмарк. Не названы ни организация, стоящая за работой, ни то, с какими именно системами сравнивали модель. Проверить эти заявления независимо по имеющемуся тексту нельзя, это описание работы её собственными авторами, без внешней проверки.
Риски и подводные камни
Главный риск, отсутствие количественных данных при заявлениях, которые касаются безопасности критичной для жизни системы: беспилотного управления автомобилем. «Высококонкурентоспособные» результаты без цифр и без указания, с чем именно сравнивали, это формулировка, которую невозможно проверить или оспорить. Пока нет ни кода, ни весов, ни опубликованных численных результатов, судить о реальном качестве модели преждевременно.
«Эксперименты показывают сильное 3D-восприятие и понимание дорожной сцены при значительном сохранении общих визуально-языковых способностей модели.»
— авторы работы о Qwen-Drive-1.0