Бенчмарк DroneCATS: ИИ-дроны путают не курс, а команду «прибыл»

Бенчмарк DroneCATS: ИИ-дроны путают не курс, а команду «прибыл»

Исследователи представили DroneCATS-Agent, архитектуру, которая вставляет мультимодальную языковую модель (MLLM) напрямую в контур управления дроном: весь набор доступных действий описан только текстом в промпте, без дообучения модели под задачу и без отдельных схем вызова функций. Модели дают свободу самой решать, когда довернуть камеру и поискать цель, когда «задуматься», если она не уверена, и когда самой объявить, что цель достигнута. Вместе с архитектурой авторы выпустили бенчмарк DroneCATS, где сама модель, переменная эксперимента: по нему сравнивают топовые (frontier) и открытые модели на четырёх задачах, подлёт к видимой цели, слежение за движущейся целью, поиск цели вне исходного поля зрения и одновременное командование несколькими дронами. В список моделей специально включили компактные версии вплоть до 2 млрд параметров, чтобы нащупать точку, где возможности начинают ломаться. Главный вывод парадоксален: подводит не полёт как таковой. Небольшие открытые модели зачастую долетают в зону успеха точнее, чем топовые, но проигрывают эпизод, объявляя прибытие слишком рано либо не объявляя его вовсе. При командовании флотом дронов разрыв усиливается: маленькие модели путаются и присваивают одну и ту же координату разным камерам вместо того, чтобы пересчитывать её под каждый вид. Авторы делают вывод: пространственное восприятие у этих моделей работает нормально, а вот дисциплина протокола действий, нет; именно способность выдерживать заявленный протокол и вовремя подать корректную завершающую команду отличает модель, пригодную для реального развёртывания на борту, от просто мощной. Открытой задачей авторы называют устранение этого разрыва при вычислительных ресурсах, доступных на борту дрона, то есть создание быстрой модели, которая последовательно планирует действия и точно знает, когда закончить; именно эту дистанцию и призван измерять DroneCATS. В тексте не названы конкретные протестированные модели, не приведены числовые показатели успешности и не сказано, опубликованы ли код и данные бенчмарка.

Ключевые факты

  • Представлены архитектура DroneCATS-Agent и одноимённый бенчмарк: MLLM управляет дроном напрямую через текстовый промпт, без дообучения и без схем вызова функций.
  • Модели проверяют на четырёх задачах: подлёт к видимой цели, слежение за движущейся целью, поиск цели вне поля зрения и командование несколькими дронами одновременно.
  • В сравнение включили модели вплоть до 2 млрд параметров, чтобы найти границу, где возможности начинают ломаться.
  • Компактные открытые модели чаще долетают до цели, чем топовые, но проваливают эпизод из-за неверного момента объявления о прибытии.
  • При управлении флотом дронов маленькие модели присваивают одну и ту же координату разным камерам вместо пересчёта под каждый вид.

Почему это важно

Работа переворачивает привычное предположение о том, что мешает языковым моделям управлять физическими устройствами. Обычно узким местом считают восприятие и пространственное мышление, способность модели «понять», где цель. Здесь показано обратное: с этим у моделей всё в порядке, а ломается протокол действий, умение вовремя и корректно завершить манёвр. Это меняет, что именно нужно улучшать, чтобы MLLM годились в роли встроенных пилотов техники.

Кому это важно

Результат адресован тем, кто строит embodied-агентов и vision-language-action системы поверх мультимодальных моделей: разработчикам автономных дронов и робототехники, командам, которые оценивают готовность LLM к прямому управлению физическими устройствами без специального дообучения под задачу.

Как это применить

Практический вывод: при оценке модели для управления дроном или другой техникой недостаточно мерить точность попадания в зону цели, нужно отдельно проверять, умеет ли модель корректно объявлять о завершении задачи и не путает ли координаты при работе с несколькими каналами данных одновременно. Компактным моделям для бортового применения, по всей видимости, нужна не столько доработка восприятия, сколько отдельная тренировка или подсказки на дисциплину протокола.

Можно ли доверять

Источник, научная работа с описанием методологии и бенчмарка, размещённая на площадке для препринтов Hugging Face Papers. В доступном тексте не названы конкретные протестированные модели, не приведены числовые показатели успешности по задачам и не сказано, выложены ли код и бенчмарк в открытый доступ, то есть перед нами качественное описание находки, а не проверяемый набор цифр.

Риски и подводные камни

Если оценивать готовность модели к управлению дроном только по точности долёта до цели, легко упустить главный источник отказов, неправильный момент завершения манёвра. В реальном применении это означает риск того, что дрон не остановится вовремя или, что опаснее, при командовании группой дронов один и тот же управляющий сигнал молча разойдётся не по тем аппаратам, а это уже вопрос безопасности при развёртывании таких систем в реальных флотах.