В TU Delft научили беспилотный автомобиль подстраивать стиль вождения под просьбы пассажиров

В TU Delft научили беспилотный автомобиль подстраивать стиль вождения под просьбы пассажиров

Исследователи из нидерландского Технического университета Делфта (TU Delft) разработали систему, которая позволяет пассажиру беспилотного автомобиля менять стиль вождения обычными словами, например, попросить «я опаздываю, езжай быстрее» или предупредить, что его укачивает. Работу возглавил Диего Мартинес-Баселга, постдок TU Delft; команда выложила препринт на arXiv и представит исследование на конференции IEEE по интеллектуальным транспортным системам (IEEE ITSC) в сентябре.

У беспилотных автомобилей за выбор безопасного и эффективного пути отвечает планировщик движения, компонент, который заранее балансирует скорость, ускорение и плавность поворотов. Обычно инженеры настраивают его параметры ещё до того, как автомобиль выйдет на дорогу, и у пассажира сегодня нет способа скорректировать манеру вождения на ходу. Новая система даёт пассажиру такую возможность голосом или текстом, не передавая ему прямого управления машиной.

Систему построили на основе разработанного тем же коллективом ранее предиктивного контроллера (на английском, model predictive path integral control): он заранее просчитывает несколько возможных траекторий движения автомобиля и оценивает их по критериям, скорость, угол поворота руля, вероятность столкновения, а затем выбирает лучшую комбинацию. К этому контроллеру подключили языковую модель GPT-4o-mini от OpenAI: она получает просьбу пассажира и текстовое описание дорожной ситуации (в исследовании его писали вручную, но в перспективе его могла бы поставлять система восприятия самого автомобиля) и на основе этого меняет вес каждого критерия, например, повышает значимость плавности поворотов и мягкости разгона, если пассажир говорит, что его укачивает. Модель не меняет настройки контроллера напрямую и не выходит за заранее заданный безопасный диапазон. Перед тем как применить изменения, система простым языком объясняет пассажиру, что собирается сделать, и ждёт подтверждения; пассажир может согласиться, уточнить просьбу или запросить новые правки, если поведение автомобиля разойдётся с ожиданиями.

Раньше в других работах уже пробовали использовать языковые и мультимодальные модели (LLM и VLM) для принятия решений о движении автомобиля напрямую, но команда TU Delft сознательно ограничилась только стилем вождения. Мартинес-Баселга объясняет это ограничениями таких моделей: у них относительно медленный отклик, который не подходит для быстрых решений за рулём, а результат нельзя гарантировать так же чётко, как у детерминированного планировщика движения. Поэтому в системе TU Delft модель только перевзвешивает критерии уже существующего безопасного контроллера, а не принимает решения о движении сама.

Систему протестировали в популярном симуляторе беспилотных автомобилей nuPlan, на сценариях выезда на оживлённое шоссе. На восьми разных запросах пассажира изменения параметров совпадали с намерением: просьбы о комфорте делали вождение более плавным, а сообщения о спешке повышали скорость. Количественных показателей точности или успеха для этих восьми запросов исследование не приводит, речь идёт только о качественном совпадении с ожиданиями; проверки на настоящем автомобиле или в других дорожных сценариях пока не было.

Подобный подход применяли и раньше: Николас Бауман, аспирант ETH Zurich, в прошлом году опубликовал исследование, где языковая модель настраивала параметры контроллера гоночного автомобиля-модели, позволяя пользователю не только менять стиль вождения, но и отдавать более конкретные команды вроде «сдай назад» или «держи заданную скорость». По словам Баумана, сила такого подхода в том, что языковая модель отделена от основного контроллера: даже если модель «галлюцинирует», это не приведёт ни к чему опасному, потому что взаимодействие на естественном языке всё равно остаётся в рамках, заданных классическим контроллером. Правда, добавляет он, настройка этих рамок требует немалой инженерной работы.

Маттиас Альтхофф, профессор Мюнхенского технического университета (TUM), специалист по киберфизическим системам, считает, что для по-настоящему доказуемой безопасности нужно идти дальше: его группа построила систему, где языковая модель предлагает решения по вождению, а отдельный математический механизм проверяет их на соответствие правилам дорожного движения и прогнозам поведения других участников движения, то есть безопасность подтверждается ещё до того, как решение применяется, чего в работе TU Delft нет. «Как и с любой LLM, нет гарантии, что результат будет правильным, говорит Альтхофф., Поэтому в своих работах мы подстраховываем решения языковой модели».

Ключевые факты

  • Команда TU Delft во главе с Диего Мартинес-Баселгой объединила языковую модель GPT-4o-mini от OpenAI с ранее разработанным ею же предиктивным контроллером движения, чтобы менять стиль вождения беспилотного автомобиля по словесным просьбам пассажира.
  • Модель не управляет автомобилем напрямую: она лишь перевзвешивает критерии планировщика движения, скорость, угол поворота руля, вероятность столкновения, в пределах заранее заданного безопасного диапазона и перед изменением спрашивает подтверждения у пассажира.
  • Систему проверили только в симуляторе nuPlan на сценариях выезда на оживлённое шоссе: на восьми разных запросах параметры менялись в соответствии с намерением пассажира (просьбы о комфорте, за плавность, о спешке, за скорость), но точных цифр успешности исследование не даёт, а тестов на настоящем автомобиле пока не было.
  • Мартинес-Баселга объясняет, почему модель не управляет машиной напрямую: у языковых и мультимодальных моделей (LLM/VLM) медленный отклик, не подходящий для быстрых решений за рулём, и они не дают таких же чётких гарантий, как детерминированный планировщик движения.
  • Мнения других исследователей расходятся: Николас Бауман (ETH Zurich) отмечает, что отделение модели от контроллера защищает от опасных действий, но требует большой инженерной работы по настройке ограничений, а Маттиас Альтхофф (Мюнхенский технический университет) считает подход неполным по безопасности: его собственная система дополнительно проверяет решения языковой модели математически на соответствие правилам дорожного движения, то, чего в работе TU Delft нет.

Почему это важно

Беспилотные автомобили балансируют скорость, ускорение и плавность поворотов по параметрам, которые инженеры выставляют заранее, у пассажира сегодня нет способа скорректировать манеру вождения на ходу, разве что молча терпеть. Работа TU Delft показывает шаблон, как добавить такую персонализацию с помощью языковой модели, не отдавая ей прямого управления автомобилем: модель только перевзвешивает параметры уже существующего безопасного контроллера и обязательно спрашивает подтверждения у человека. Это пример того, как языковые модели можно встраивать в системы, где ошибка дорого стоит, не как «водителя», а как переводчика нечётких пожеланий человека в понятные машине настройки.

Кому это важно

В первую очередь, разработчикам беспилотных автомобилей и роботов, которые ищут способ дать пассажирам ощущение контроля без риска для безопасности; исследователям, изучающим, как безопасно встраивать языковые модели в системы с жёсткими ограничениями (не только автомобили, но и любую робототехнику, где ошибка имеет физические последствия); и создателям интерфейсов «человек, машина», которым нужен пример работы с подтверждением действий человеком. Для обычного пассажира это пока не готовый продукт, а демонстрация направления, куда может двигаться салон беспилотного такси или личного автомобиля.

Как это применить

Прямо сейчас применить нечего, это исследовательский прототип, доступный пока как препринт на arXiv и презентация на конференции IEEE ITSC в сентябре, протестированный только в симуляторе nuPlan на одном типе сценария (выезд на оживлённое шоссе). Чтобы довести идею до дороги, нужно как минимум: подключить вместо ручного описания ситуации данные системы восприятия автомобиля в реальном времени, проверить больше типов дорожных сценариев и протестировать систему на настоящей машине, а не только в симуляции. Инженерам, которые захотят повторить подход, стоит обратить внимание на главную идею, не давать языковой модели прямого доступа к управлению, а использовать её только для перевзвешивания параметров уже проверенного контроллера безопасности.

Можно ли доверять

Источник, IEEE Spectrum, авторитетное издание в области техники; материал выходит в рамках его серии IEEE Journal Watch, посвящённой разбору свежих исследований в партнёрстве с IEEE Xplore. Помимо ведущего автора работы, журналист взял комментарии у двух независимых исследователей, Баумана и Альтхоффа, которые не участвовали в проекте и прямо указывают на его ограничения; это добавляет изданию баланса. При этом сама работа, пока лишь препринт на arXiv и презентация на конференции IEEE ITSC в сентябре, протестированный только в симуляторе на одном типе сценария; исследование не даёт ни одной количественной оценки точности, а испытаний на настоящем автомобиле не было. Это добросовестное описание раннего исследования, а не готовое достижение, и выводы стоит воспринимать именно так.

Риски и подводные камни

Просьбы вроде «поезжай быстрее» субъективны, и языковая модель может неверно их истолковать. Систему подстраховывает то, что перед применением изменений она сначала описывает их обычным языком и ждёт согласия пассажира, но это работает, только если пассажир действительно внимателен, а не просто соглашается не глядя. Сама статья признаёт ещё один источник ошибки: модель может неточно описать, что именно она собирается изменить, и одно лишь подтверждение этого не устраняет. Систему проверили ровно на одном типе сценария, выезд на оживлённое шоссе, и в одном симуляторе; неизвестно, как она поведёт себя в других дорожных условиях или на настоящей машине. И, в отличие от подхода Альтхоффа, здесь нет математически доказанной проверки, что каждое конкретное решение модели безопасно, безопасность держится на заранее заданных границах, а настройка этих границ, по словам Баумана, требует немалой инженерной работы.

«Задача планирования движения, это не только добраться до места, избежав столкновений, но и то, как именно вы это делаете.»

— Диего Мартинес-Баселга, ведущий автор исследования, постдок TU Delft