DriveZero: автономное вождение обучили без копирования поездок человека

DriveZero: автономное вождение обучили без копирования поездок человека

Большинство современных end-to-end систем автономного вождения обучаются, имитируя записи реальных поездок человека, поэтому их поведение ограничено качеством и разнообразием этих записей: чего не было в логах, того система не умеет. Авторы предлагают DriveZero, систему, которая учится вести машину и за пределами того, что делал человек.

DriveZero разбивает задачу на два отдельных модуля с разными рецептами обучения: модель восприятия и модель действия. Восприятию нужно понимать мир, и для этого полезны большие и разнообразные визуальные данные; действию нужно взаимодействовать с миром, и для этого нужна обратная связь в замкнутом цикле (closed-loop).

За восприятие отвечает DriveVFM, модуль, который объединяет несколько уже обученных и замороженных базовых зрительных моделей (DINOv3, SigLIP2, SAM и Depth Anything V2) в единый бэкбон, работающий напрямую с сырыми изображениями и не требующий разметки под конкретную задачу.

За действие отвечает DriveRL, фреймворк обучения с подкреплением со смешанными агентами в замкнутом цикле. Он превращает реальные логи вождения в интерактивные симулированные миры, в которых по алгоритму PPO обучается «привилегированная» модель-учитель, имеющая доступ к дополнительной информации о сцене.

DriveZero объединяет оба модуля: камера-only планировщик обучается, дистиллируя (перенимая) поведение замороженного учителя DriveRL по его смоделированным траекториям. При этом учителя, обусловленного целью, можно опрашивать при разных, в том числе усиленных вариантах намерения водителя, это даёт разнообразные, но согласованные с целью примеры для обучения, которых просто нет в записанных логах.

По заявленным результатам, DriveRL с поиском действий по ценностной функции на этапе вывода достигает среднего балла 93.57 на бенчмарке nuPlan, по сплитам Val14, Test14-hard и Test14-random сообщества, в обоих режимах (без реакции окружения и с реакцией), превосходя эталон Log-Replay на всех трёх сплитах. Итоговая система DriveZero достигает лучших результатов среди опубликованных (state-of-the-art) на бенчмарках NAVSIMv1, NAVSIMv2 и замкнутом (closed-loop) бенчмарке HUGSIM, без какого-либо обучения на человеческих траекториях.

Ключевые факты

  • DriveZero разделяет задачу автономного вождения на модель восприятия (DriveVFM) и модель действия (DriveRL), обучает их раздельно и затем объединяет в единый end-to-end планировщик.
  • DriveVFM собирает несколько уже обученных и замороженных зрительных моделей, DINOv3, SigLIP2, SAM и Depth Anything V2, в один бэкбон по сырым изображениям, без разметки под задачу.
  • DriveRL, фреймворк обучения с подкреплением (PPO) в замкнутом цикле: реальные логи вождения превращаются в интерактивные симулированные миры, где обучается «привилегированная» модель-учитель.
  • На бенчмарке nuPlan DriveRL показывает средний балл 93.57 по трём сплитам (Val14, Test14-hard, Test14-random) в обоих режимах реактивности, превосходя эталон Log-Replay на всех трёх.
  • Итоговый камера-only планировщик DriveZero достигает лучших опубликованных результатов на NAVSIMv1, NAVSIMv2 и closed-loop бенчмарке HUGSIM, не используя ни одной человеческой траектории для обучения.

Почему это важно

Имитационное обучение (обучение по записям человека), основной способ учить системы автономного вождения, но у него жёсткий потолок: система не может научиться поведению, которого не было в логах, а качество и разнообразие логов ограничены тем, что реально успел проехать человек-водитель. DriveZero предлагает выход, заменить копирование человека обучением с подкреплением в симулированном, но построенном на реальных данных мире, а восприятие мира построить не с нуля, а из уже существующих, обученных на других задачах зрительных моделей. Это меняет саму архитектуру решения: вместо одной сети, обучаемой имитацией «от начала до конца», два модуля с разными рецептами обучения, соединённые дистилляцией.

Кому это важно

В первую очередь, исследователям и инженерам, которые занимаются автономным вождением и робототехникой и упираются в потолок имитационного обучения. Подход интересен и шире: идея «заморозить несколько готовых зрительных базовых моделей и собрать их в один бэкбон без дообучения под задачу» может переноситься на другие задачи восприятия за пределами вождения, а связка «RL-учитель в симуляции на реальных логах → дистилляция в компактный планировщик», на другие сценарии планирования действий в реальном мире.

Как это применить

Практическая идея статьи разложена на два переносимых блока. Первый: не обучать модель восприятия с нуля, а собрать её из нескольких уже готовых замороженных базовых моделей (в данном случае DINOv3, SigLIP2, SAM, Depth Anything V2), не тратясь на разметку под конкретную задачу. Второй: реальные записанные логи можно превратить не в статичный обучающий набор для имитации, а в интерактивный симулированный мир для обучения с подкреплением в замкнутом цикле, где обучается модель-учитель с доступом к дополнительной, «привилегированной» информации, а затем эта модель дистиллируется в конечный планировщик, работающий только по камере.

Можно ли доверять

Это исследовательская публикация (препринт на arXiv, страница на Hugging Face), а не производственный продукт с независимым внешним аудитом. Числовой результат приведён только один, средний балл 93.57 на бенчмарке nuPlan, причём он получен для промежуточной модели DriveRL, а не для итогового DriveZero. Для заявленных результатов state-of-the-art итоговой системы DriveZero на бенчмарках NAVSIMv1, NAVSIMv2 и HUGSIM конкретные числовые баллы в тексте не приводятся, указано только само превосходство над предыдущими методами. Бенчмарки (nuPlan, NAVSIM, HUGSIM), признанные в области стандарты, но результаты пока не подтверждены сторонними воспроизведениями.

Риски и подводные камни

Главная оговорка, отсутствие в тексте числовых баллов для результатов DriveZero на NAVSIMv1, NAVSIMv2 и HUGSIM: приведено только качественное «лучший результат», без цифр, с которыми можно сравнить конкурентов напрямую. Сравнение с другими методами в тексте ограничено единственным упоминанием превосходства над эталоном Log-Replay, более широкая таблица результатов конкурентов не приводится. Не раскрыты объём вычислений, размер обучающих данных и сроки обучения ни для DriveRL, ни для сборки DriveVFM. И, как у любой системы, обученной и проверенной в бенчмарках и симуляции, остаётся открытым вопрос переноса результатов на реальное безопасное вождение вне тестовых сценариев.