Метод CARE подбирает ускорение VLA-моделей с гарантией по риску провалов

Метод CARE подбирает ускорение VLA-моделей с гарантией по риску провалов

VLA-модели (vision-language-action, «зрение, язык, действие») быстро развиваются, но запускать их на каждом шаге управления дорого. Существующие работы ускоряют вывод такими приёмами, как action chunking (группировка действий в блоки) и отсечение визуальных токенов, а оценивают обычно по задержке и средней успешности задач. Авторы статьи указывают на скрытый риск: ускорение может отбросить информацию и сломать задачи, которые исходная политика решала, а средние метрики этот риск не показывают.

Измерить такие провалы непросто: отклонения действий накапливаются на замкнутых траекториях, поэтому о провале задачи можно судить только по полному эпизоду. Поэтому авторы определяют «отказ, вызванный ускорением» через парные прогоны из одинаковых начальных условий: эталонная политика справляется с задачей, а ускоренная, нет.

На этом построен CARE, подход к сертифицированному выбору ускорителя. На калибровочном наборе он делает парные прогоны и даёт гарантии для конечной выборки: риск отказа, вызванного ускорением, не превышает бюджет, заданный пользователем. Затем разворачивается самый быстрый из сертифицированных кандидатов, а если ни один не прошёл проверку, система возвращается к эталонной политике. Метод опирается только на итоговые исходы эпизодов и измеренные вычислительные затраты, поэтому применим без изменений к разным механизмам ускорения. Последовательное тестирование и эталонные прогоны, запускаемые только после сбоя, делают сертификацию недорогой.

На четырёх наборах LIBERO с OpenVLA-OFT CARE сертифицирует ускорение в 9,0-10,8 раза и гарантирует с доверительной вероятностью 95%, что сохраняется не менее 85,8% эпизодов, которые решала эталонная политика. При жёстких бюджетах селекторы без гарантий выходят за бюджет в долях испытаний до 75%, тогда как CARE остаётся в пределах бюджета; его последовательная форма использует на 78,9% меньше прогонов, чем полный перебор. Авторы также показывают, что CARE обобщается на сокращение числа шагов потока (flow) для π0.5 и на агентов Qwen3.5-9B и Llama-3.1-8B в среде Crafter.

Ключевые факты

  • CARE выбирает ускоритель VLA-модели по парным прогонам на калибровочном наборе и даёт гарантии для конечной выборки: риск провалов, вызванных ускорением, не выше заданного пользователем бюджета.
  • Разворачивается самый быстрый сертифицированный кандидат; если таких нет, остаётся эталонная политика.
  • На четырёх наборах LIBERO с OpenVLA-OFT сертифицировано ускорение в 9,0, 10,8 раза при гарантии (95% доверия), что сохраняется не менее 85,8% эпизодов, решённых эталоном.
  • При жёстких бюджетах селекторы без гарантий превышают бюджет в долях испытаний до 75%, а CARE остаётся в бюджете.
  • Последовательная форма CARE использует на 78,9% меньше прогонов, чем полный перебор; метод обобщается на π0.5 и агентов Qwen3.5-9B и Llama-3.1-8B в Crafter.

Почему это важно

Ускорение VLA-моделей обычно проверяют по задержке и средней успешности, а средние значения могут скрывать задачи, которые исходная модель решала, а ускоренная ломает. CARE предлагает иной критерий: считать именно такие парные провалы и заранее сертифицировать, что их доля не превысит бюджет. Это переводит выбор ускорителя от «в среднем почти не хуже» к формальной гарантии с заданным уровнем доверия.

Кому это важно

Исследователям и инженерам, которые ускоряют вывод VLA-моделей для управления роботами и сравнивают разные приёмы (action chunking, отсечение визуальных токенов, сокращение шагов потока). Метод также интересен тем, кто строит агентов на языковых моделях: авторы проверили его на Qwen3.5-9B и Llama-3.1-8B в среде Crafter.

Как это применить

По описанию авторов, процедура такова: задать допустимый бюджет риска, прогнать эталонную политику и каждого кандидата-ускорителя парными прогонами из одинаковых начальных условий на калибровочном наборе, сертифицировать тех, кто укладывается в бюджет, и развернуть самого быстрого из них. Если сертифицировать некого, остаётся эталонная политика. Поскольку метод использует только итоговые исходы эпизодов и измеренные вычислительные затраты, он не привязан к конкретному механизму ускорения. Чтобы не гонять полный перебор, предлагается последовательное тестирование: его последовательная форма требует на 78,9% меньше прогонов.

Можно ли доверять

Все цифры взяты из аннотации статьи и представляют собой заявления самих авторов. Основная оценка проведена на четырёх наборах LIBERO с OpenVLA-OFT; дополнительные проверки, π0.5 и агенты в Crafter. Реальные роботы в аннотации не упомянуты. Авторы и организации в аннотации не названы, значение бюджета, при котором получена цифра 85,8%, не указано, абсолютные показатели задержки не приведены, ускорение дано только в кратностях.

Риски и подводные камни

Гарантия вероятностная: 85,8%, нижняя граница сохранённых эпизодов при доверии 95%, а не обещание отсутствия потерь. Сертификация требует парных прогонов на калибровочном наборе, то есть дополнительных затрат на эталонные прогоны, которые метод лишь сокращает. Если ни один кандидат не проходит проверку, ускорения не будет вовсе: система вернётся к эталону. Результаты получены в симуляционных средах LIBERO и Crafter, а перенос на реальных роботов в аннотации не показан.

«Ускорение может отбросить информацию и сломать задачи, которые решала исходная политика, риск, скрытый за средними метриками.»

— Из аннотации статьи о CARE