RxBrain: модель, которая планирует действия роботов через язык и визуальное воображение

RxBrain: модель, которая планирует действия роботов через язык и визуальное воображение

Хаотянь Лян с соавторами представили Hy-Embodied-RxBrain (сокращённо RxBrain), базовую модель для «воплощённого познания» (embodied cognition), то есть для задач, где ИИ должен связать высокоуровневое рассуждение о задаче с реальными физическими состояниями, которые нужно достичь. Авторы отмечают разрыв в существующих подходах: модели языка и зрения (vision-language models) хороши в понимании сцены и текстовых решениях, но не предсказывают физическое будущее, а генеративные world-модели, наоборот, умеют предсказывать будущие визуальные кадры, но слабы в текстовом рассуждении. RxBrain объединяет оба режима в единой последовательности планирования: язык задаёт абстрактную структуру плана, разбиение задачи на шаги, примитивы действий, ограничения, порядок во времени и логику принятия решений, а визуальное воображение «заземляет» эту структуру, предсказывая состояния мира и совместные подцели, то есть привязывая каждый шаг плана к промежуточным и итоговым физическим состояниям в виде изображений.

Архитектурно RxBrain построен на единой мультимодальной модели типа Mixture-of-Transformers, которая в рамках одной сети понимает и генерирует текст, изображения и видео. Для обучения авторы построили автоматический конвейер, который превращает видео с действиями роботов или людей в парные текстово-визуальные данные для обучения планированию: видео разбивается на шаги плана, и каждый шаг сопоставляется с соответствующими визуальными переходами состояний мира. Отдельно команда предложила новый бенчмарк RxBrain-Bench, он проверяет, способна ли модель представлять план воплощённых действий совместно через текст и изображения, а не решать задачи понимания и генерации по отдельности.

По результатам экспериментов RxBrain сохраняет обычные способности понимания и генерации (текста, изображений, видео) и при этом строит планы, где текстовое рассуждение, предсказание состояния мира и планирование подцелей связаны друг с другом. Авторы также расширили модель на генерацию непрерывных управляющих команд для роботов и показали многообещающие результаты на реальном роботе, без масштабного предобучения на размеченных данных действий робота, которое обычно требуется моделям для робототехники. Сами авторы описывают эту работу как первый шаг к полноценным базовым моделям воплощённого познания, а не как готовое законченное решение.

Ключевые факты

  • Хаотянь Лян с соавторами представили RxBrain (Hy-Embodied-RxBrain), базовую модель, которая связывает рассуждение о задаче с физическими состояниями мира для планирования действий роботов
  • Модель объединяет языковое планирование (шаги, ограничения, порядок, логика решений) и визуальное воображение будущих состояний в одной последовательности планирования, в отличие от моделей языка-зрения (только текст) или world-моделей (только визуальное предсказание)
  • Архитектура, единая мультимодальная модель типа Mixture-of-Transformers, понимающая и генерирующая текст, изображения и видео в одной сети
  • Авторы построили автоматический конвейер, превращающий видео действий в парные текстово-визуальные данные для обучения планированию, и новый бенчмарк RxBrain-Bench для оценки совместного текстово-визуального планирования
  • Модель расширили на генерацию непрерывных команд управления роботом и показали многообещающие результаты на реальном роботе без масштабного предобучения на данных действий

Почему это важно

Большинство современных систем ИИ для роботов решают задачу планирования только с одной стороны: либо через язык (модели языка-зрения хорошо понимают сцену и рассуждают текстом, но не предсказывают физическое будущее), либо через изображение (генеративные world-модели предсказывают будущие кадры, но плохо рассуждают текстом о задаче). RxBrain, попытка соединить оба режима в одной модели и одной последовательности планирования, где текст задаёт структуру плана, а визуальное воображение привязывает каждый шаг к конкретным физическим состояниям. Это концептуальный шаг к более цельным базовым моделям для роботов, а не просто ещё одна отдельная система понимания сцены или генерации видео.

Кому это важно

В первую очередь исследователям и инженерам в области робототехники и воплощённого ИИ (embodied AI), которые работают над базовыми моделями для управления роботами и планирования их действий. Также работа интересна командам, которые строят обучающие датасеты и бенчмарки для мультимодального планирования, предложенные авторами конвейер разметки видео и бенчмарк RxBrain-Bench можно использовать как ориентир при оценке похожих моделей.

Как это применить

Практическая ценность работы, не в готовом продукте, а в подходе и инструментах: автоматическом конвейере превращения видео действий в обучающие данные для совместного текстово-визуального планирования и в бенчмарке RxBrain-Bench для проверки, действительно ли модель планирует через текст и изображения совместно, а не решает эти задачи по отдельности. Авторы также показывают, что подход можно расширить до генерации непрерывных команд управления реальным роботом без отдельного масштабного предобучения на данных действий, это может снизить порог входа для команд, у которых нет больших массивов размеченных траекторий робота. Цена, лицензия или условия доступа к коду и весам модели в тексте не указаны.

Можно ли доверять

Это препринт с научной ветрины HuggingFace Papers (arXiv 2607.14187), а не проверенная временем публикация в рецензируемом издании, на момент публикации у материала всего 25 отметок и 2 комментария, то есть широкого независимого обсуждения пока не было. Первый автор, Хаотянь Лян, но у работы, судя по формату таких публикаций, есть и другие соавторы, не перечисленные в исходных метаданных. Результаты на реальном роботе представлены как «многообещающие», но количественные детали экспериментов (число задач, метрики успеха, сравнение с другими моделями) в доступном тексте аннотации не раскрыты, судить о зрелости результата можно будет только после публикации полной статьи и независимых проверок.

Риски и подводные камни

Все заявленные результаты пока исходят только от самих авторов и не прошли независимую проверку. Аннотация не раскрывает масштаб экспериментов на реальном роботе и то, насколько хорошо модель обобщается за пределы обучающих сценариев, а перенос с симуляции или размеченных видео на реальную робототехнику традиционно оказывается самым слабым местом подобных систем. Сами авторы прямо называют работу лишь «первым шагом» к базовым моделям воплощённого познания, то есть подчёркивают экспериментальный, не готовый к продакшену статус модели.

«Эти результаты представляют собой первый шаг к базовым моделям воплощённого познания.»

— из аннотации статьи RxBrain, HuggingFace Papers