TurboVLA: модель для роботов обходится без LLM и уместилась в 1 ГБ видеопамяти

TurboVLA: модель для роботов обходится без LLM и уместилась в 1 ГБ видеопамяти

Модели класса VLA (vision-language-action, «зрение-язык-действие») учат роботов превращать картинку с камеры и текстовую команду в конкретное движение. Обычная схема устроена так: изображение сначала преобразуется во внутреннее представление большой языковой модели (LLM), и только потом эта модель решает, какое действие выполнить, путь «зрение → язык → действие». Это работает, но каждый вызов такой модели требует больших вычислений и памяти, потому что в центре системы стоит тяжёлая LLM.

TurboVLA меняет саму схему: вместо пропускания зрения через языковую модель она напрямую сводит зрение и язык в действие («зрение + язык → действие»). Визуальные наблюдения и текстовая инструкция обрабатываются раздельно, лёгкий модуль двустороннего взаимодействия обменивается информацией между ними, а компактный декодер сразу предсказывает последовательность (chunk) непрерывных действий робота. Большая языковая модель как центральный узел из системы исключена целиком.

На стандартном бенчмарке LIBERO TurboVLA показала 97,7% успешных выполнений заданий, на уровне или выше результатов значительно более крупных VLA-моделей. При этом сама модель занимает всего 0,2 млрд параметров, время отклика на один шаг, 31,2 мс, а инференс требует менее 1 ГБ видеопамяти (0,9 ГБ) на обычной игровой видеокарте RTX 4090, без серверного оборудования. Код модели выложен в открытом доступе на GitHub.

Ключевые факты

  • TurboVLA заменяет привычную схему «зрение → язык → действие» через большую языковую модель на прямую схему «зрение + язык → действие» без LLM в центре.
  • На бенчмарке LIBERO модель достигла 97,7% успешных выполнений заданий, на уровне или лучше значительно более крупных VLA-моделей.
  • Модель компактна: 0,2 млрд параметров.
  • Время отклика, 31,2 мс, инференс укладывается менее чем в 1 ГБ (0,9 ГБ) видеопамяти на потребительской RTX 4090.
  • Код опубликован в открытом доступе на GitHub.

Почему это важно

Большинство VLA-моделей для роботов устроены вокруг большой языковой модели: картинка с камеры сначала преобразуется в представление LLM, и лишь затем из него извлекается команда движения. Это надёжно работает, но каждый вызов такой модели, это существенные вычислительные затраты и расход памяти просто на то, чтобы «прогнать» зрение через языковую модель. TurboVLA убирает LLM из центра схемы и напрямую связывает зрение и язык с действием через лёгкий модуль взаимодействия и компактный декодер, поэтому конечная модель получается на порядки экономнее по параметрам и памяти при сравнимом или лучшем качестве.

Кому это важно

В первую очередь, разработчикам робототехники и систем манипуляции (роборуки, автономные захваты и подобные задачи), которым сейчас часто приходится ставить дорогое серверное оборудование только ради инференса тяжёлой VLA-модели. Также это важно для исследователей embodied AI, которые ищут более дешёвые и быстрые архитектуры для соединения зрения, языка и действия, и для компаний, которые хотят разворачивать робототехнику на ограниченном бюджете вычислений, вплоть до одной потребительской видеокарты.

Как это применить

Код TurboVLA выложен в открытом доступе на GitHub, поэтому воспроизвести и протестировать модель можно самостоятельно. Ключевое практическое следствие результатов, что для инференса достаточно обычной игровой видеокарты RTX 4090 и менее 1 ГБ видеопамяти, а время отклика в 31,2 мс укладывается в реальное время управления роботом. Это снижает порог входа для команд, которые раньше не могли себе позволить серверные GPU под VLA-инференс.

Можно ли доверять

Материал, научная публикация с описанной архитектурой и числовыми результатами на стандартном для робот-манипуляции бенчмарке LIBERO, плюс открытый код на GitHub, это позволяет независимо проверить заявленные цифры. При этом на момент публикации у материала всего 40 баллов и один комментарий на площадке, то есть широкой независимой проверки сообществом результаты пока не прошли, это ранняя, ещё не верифицированная извне работа.

Риски и подводные камни

В тексте не сказано, тестировалась ли TurboVLA на реальных роботах в реальной среде или только в условиях бенчмарка LIBERO, успех в бенчмарке не гарантирует такого же качества на «живом» оборудовании с шумом сенсоров и непредсказуемой обстановкой. Также в источнике нет данных об обучающих данных модели и о том, насколько хорошо она обобщается на задачи и инструкции, сильно отличающиеся от тех, что были в LIBERO.