StreamPI научил роботов помнить прошлое и обошёл модель pi0.5

StreamPI научил роботов помнить прошлое и обошёл модель pi0.5

Модели класса VLA (vision-language-action, дословно «зрение, язык, действие») превращают команду на естественном языке и картинку с камеры в движения робота-манипулятора. Как отмечают авторы работы, даже передовые VLA-модели вроде pi0.5 обычно работают по «однокадровому» принципу: на каждом шаге модель видит только текущий кадр и не хранит историю прошлых наблюдений. Из-за этого страдает и способность помнить, что происходило раньше, и точность восприятия положения объектов в пространстве.

Чтобы решить эту проблему, исследователи предложили StreamPI, фреймворк потокового многомодального временного моделирования, который добавляет однокадровым VLA-моделям способность рассуждать о времени, не вводя ни единого нового параметра. Ключевая идея, «привязка к инструкции»: пара «визуальное наблюдение + языковая команда» рассматривается как один атомарный временной блок. Внутри пары действует двунаправленное внимание, которое сливает картинку и текст команды между собой; а между парами по времени, каузальное внимание, которое смотрит только в прошлое и тем самым сохраняет потоковый, авторегрессионный вывод, пригодный для работы в реальном времени. Благодаря этому языковая инструкция остаётся «смысловым якорем» на всё время выполнения задачи.

Отдельная сложность, переход от обучения к работе на настоящем роботе: при обучении кадры поступают синхронно и равномерно, а на реальном роботе, асинхронно, с непредсказуемыми задержками. Для этого авторы предложили стратегию обучения со случайным интервалом между кадрами: подходящий интервал (например, каждый 3-й кадр) уже даёт более быстрое и плавное исполнение действий, а если сам интервал во время обучения ещё и варьировать случайным образом, устойчивость модели к сбоям тайминга кадров растёт дальше, это и позволяет разворачивать её асинхронно в реальных условиях.

Ещё один плюс подхода, совместимость с уже обученными моделями: за счёт способности базовой языковой модели экстраполировать длину контекста StreamPI напрямую наследует веса уже обученной однокадровой модели, переобучать с нуля не нужно, а сам фреймворк гибко поддерживает и однокадровый, и многокадровый режим вывода.

В экспериментах, на задачах для реальных роботов, требующих памяти о прошлом и точного восприятия пространства, а также на симуляционном бенчмарке LIBERO, StreamPI превзошёл модель pi0.5 на разных типах задач. Конкретных цифр прироста (насколько именно выше точность или доля успешных попыток) в тексте не приведено, указан только сам факт превосходства.

Ключевые факты

  • StreamPI, фреймворк потокового временного моделирования: добавляет однокадровым VLA-моделям для роботов память о прошлых кадрах без единого нового параметра.
  • Работает через «привязку к инструкции»: пара «кадр + команда» обрабатывается двунаправленным вниманием, а между парами по времени, каузальным, которое сохраняет потоковый вывод и удерживает инструкцию как смысловой якорь на всю задачу.
  • Для асинхронной работы на реальном роботе предложено обучение со случайным интервалом между кадрами (пример базового интервала, каждый 3-й кадр); рандомизация интервала повышает устойчивость к сбоям тайминга.
  • За счёт экстраполяции длины контекста базовой языковой модели StreamPI напрямую использует уже обученные однокадровые веса, переобучать с нуля не нужно, и поддерживает и одно-, и многокадровый режим вывода.
  • На реальных роботах (задачи, требующие памяти и точного восприятия) и в симуляции LIBERO StreamPI превосходит модель pi0.5; конкретные цифры прироста в источнике не приведены.

Почему это важно

Однокадровый режим, известное узкое место сегодняшних VLA-моделей: без памяти о прошлых наблюдениях модель хуже отслеживает состояние сцены и хуже оценивает точное расположение объектов, а это критично для аккуратных манипуляций и задач, где важно помнить, что уже сделано. StreamPI решает это не увеличением модели и не заменой архитектуры, а изменением того, как модель обрабатывает поток кадров во времени: способность помнить прошлое добавляется без единого нового параметра модели.

Кому это важно

Тем, кто разрабатывает и обучает VLA-модели для роботов-манипуляторов: подход даёт способ добавить модели «память» без замены архитектуры и без обучения с нуля. Актуально для команд, уже использующих однокадровые модели вроде pi0.5, им не нужно выбрасывать обученные веса, а также для инженеров, которые разворачивают такие модели на реальном роботе, где кадры поступают не синхронно, как при обучении, а с задержками.

Как это применить

StreamPI наследует уже обученные однокадровые веса благодаря способности базовой языковой модели экстраполировать длину контекста, отдельно обучать модель с нуля не требуется, а сам фреймворк поддерживает и однокадровый, и многокадровый режим вывода. Стратегию обучения со случайным интервалом между кадрами (от примера «каждый 3-й кадр» до рандомизации интервала) можно использовать как рецепт подготовки модели именно к асинхронной работе на реальном роботе, а не только к синхронным условиям обучения.

Можно ли доверять

Работа, исследовательская публикация (страница на Hugging Face Papers), а не готовый продукт; в самом тексте нет ни имён авторов, ни организации, ни издания, ни даты публикации, проверить репутацию и факт рецензирования не по чему. В пользу доверия, результат проверен не только в симуляции (бенчмарк LIBERO), но и на реальных роботах, а сравнение идёт с конкретной, ранее известной моделью (pi0.5). Минус, конкретных цифр прироста, насколько именно StreamPI лучше pi0.5, в тексте нет: указан только сам факт превосходства.

Риски и подводные камни

Главный риск, неизвестен размер эффекта: без цифр «превосходит pi0.5» может означать как решающий отрыв, так и минимальный перевес на части задач. Список реальных роботизированных задач в тексте не детализирован, названы только общие категории («требующие памяти» и «точного восприятия»), без точного числа и описания. Сравнение приведено только с одной моделью (pi0.5), а не с широким кругом альтернативных VLA-подходов, и результат пока не проходил независимую проверку за пределами текста самой публикации.