Представлен PyRUA-Lean: агенты для роботов на GPT-6 Astra экономят токены

Агенты на основе визуально-языковых моделей (VLM) умеют управлять роботами: они получают изображения с камер и выбирают готовые действия-примитивы. Но у такого подхода есть цена: повторные обращения к модели и избыточные наблюдения приводят к большому расходу токенов. Это исходная проблема, с которой начинают авторы работы.
Они предлагают PyRUA-Lean, интерактивный фреймворк исполнения кода. Агент не вызывает инструменты по одному, а собирает из классических робототехнических примитивов и обученных VLA-политик (моделей «зрение, язык, действие») ячейки на Python. Внутри ячейки можно делать условные проверки и локальные повторные попытки. Назад модели возвращаются только те изображения и данные о состоянии, которые агент явно запросил, их она использует для перепланирования.
Проверка шла на 700 симулированных экземплярах задач из бенчмарков LIBERO-PRO, RoboTwin 2.0 и RoboCasa365. PyRUA-Lean сравнивали с базовым агентом, вызывающим инструменты; у обоих планировщиком служила одна и та же модель GPT-6 Astra и одни и те же примитивы робота.
При равном бюджете вызовов LLM общий успех вырос с 63,1% до 71,7% (разница 8,6 процентного пункта). На задачах, которые решили оба агента, PyRUA-Lean делал на 49% меньше вызовов LLM и тратил на 65% меньше входных токенов. Экономия посчитана только на таких общих задачах и только по входным токенам.
Ключевые факты
- PyRUA-Lean, интерактивный фреймворк, где агент собирает примитивы робота и VLA-политики в Python-ячейки с условными проверками и локальными повторами.
- Модели возвращаются только явно запрошенные изображения и данные о состоянии, что снижает избыточные наблюдения.
- Тест: 700 симулированных экземпляров задач из LIBERO-PRO, RoboTwin 2.0 и RoboCasa365; база сравнения, агент с вызовом инструментов на том же планировщике GPT-6 Astra.
- При равных бюджетах вызовов LLM общий успех вырос с 63,1% до 71,7%.
- На задачах, решённых обоими агентами, вызовов LLM на 49% меньше, входных токенов, на 65% меньше.
Почему это важно
Роботы под управлением VLM-агентов упираются в стоимость: каждый вызов модели и каждое изображение добавляют токены. Работа показывает, что если вместо пошагового вызова инструментов дать агенту писать короткие программы с проверками и повторами, то в симуляции растёт доля решённых задач и падает число обращений к модели и входных токенов.
Кому это важно
Разработчикам робототехнических систем на базе языковых моделей, исследователям агентов с VLA-политиками и командам, которые считают расходы на LLM при управлении роботами в циклах «наблюдение, действие».
Как это применить
Идея из описания: отдавать модели не весь поток наблюдений, а только то, что агент сам запросил, и выносить условные проверки и повторные попытки в исполняемый код, а не в отдельные обращения к модели. Сведений о доступности кода, модели или лицензии в источнике нет.
Можно ли доверять
Заметка основана на аннотации работы с Hugging Face; авторы и организации в ней не названы. Все результаты получены в симуляции на трёх бенчмарках, сравнение шло при равных бюджетах вызовов LLM и на одном планировщике. Цифры экономии по вызовам и токенам относятся только к задачам, решённым обоими агентами.
Риски и подводные камни
Выигрыш в 49% по вызовам и 65% по входным токенам измерен лишь на пересечении успешно решённых задач, поэтому на всём наборе он может быть иным; он касается именно входных токенов, а не общего расхода. Результаты получены в симуляции, данных по реальным роботам в источнике нет. Разбивки по отдельным бенчмаркам тоже не приведены. Прирост успеха, 8,6 п.п. (с 63,1% до 71,7%); цифра «14%» из заголовка исходной карточки в тексте не подтверждается.