RynnBrain 1.1: модель для роботов обошла конкурентов в тестах на пространственное мышление

RynnBrain 1.1: модель для роботов обошла конкурентов в тестах на пространственное мышление

Исследователи представили RynnBrain 1.1, семейство фундаментальных моделей для «воплощённого» ИИ (embodied AI, систем, управляющих физическими роботами), выпущенное в трёх размерах: 2, 9 и 122 млрд параметров (у крупнейшей версии, обозначенной 122B-A10B, за один проход активны 10 млрд параметров). Все модели обучены в рамках единого пространственно-временного каркаса, привязанного к физике реального мира, и умеют распознавать окружение, рассуждать о пространстве, определять положение объектов и планировать действия.

По сравнению с версией RynnBrain 1.0 у 1.1 появилось предсказание точек контакта (мест, которыми робот должен коснуться объекта), эта возможность добавлена во все размеры модели. Модели на 2 и 9 млрд параметров дополнительно получили нативную 3D-локализацию объектов, из-за чего их внутренние представления и результаты точнее соответствуют задачам физического манипулирования предметами.

На базе RynnBrain 1.1 авторы также разработали RynnBrain-VLA (vision-language-action, «зрение-язык-действие»), модель с единым пространством действий, работающим сразу для разных типов роботов, и механизмом маскирования, учитывающим особенности конкретной робототехнической платформы. Её развернули на трёх реальных роботах: гуманоидах Unitree G1 и Astribot S1, а также на платформе Tianji-Wuji.

В тестах на восприятие пространства, локализацию и 3D-привязку объектов версия 122B-A10B превзошла все проверенные закрытые и открытые модели-конкуренты на трёх бенчмарках, VSI-Bench, MMSI и RefSpatial-Bench. В экспериментах на реальных роботах политики (алгоритмы управления), инициализированные RynnBrain, показали лучшие результаты, чем модели на базе Qwen и другие универсальные VLA-модели. Совместное обучение сразу на нескольких задачах и нескольких типах роботов дало более высокие оценки процесса выполнения и долю успешных попыток по сравнению с обучением под каждую задачу отдельно.

Ключевые факты

  • RynnBrain 1.1, семейство из трёх моделей воплощённого ИИ: 2, 9 и 122 (активных 10) млрд параметров
  • Новое по сравнению с версией 1.0: предсказание точек контакта во всех размерах и нативная 3D-локализация объектов в моделях на 2 и 9 млрд параметров
  • На базе модели разработана RynnBrain-VLA и развёрнута на трёх реальных роботах: Unitree G1, Astribot S1, Tianji-Wuji
  • Старшая модель 122B-A10B обошла все проверенные закрытые и открытые модели на бенчмарках VSI-Bench, MMSI и RefSpatial-Bench
  • На реальных роботах политики на базе RynnBrain обогнали модели на Qwen и другие универсальные VLA; совместное обучение на нескольких задачах и роботах дало более высокую долю успешных попыток, чем обучение под одну задачу

Почему это важно

RynnBrain 1.1, очередной шаг к «универсальному мозгу» для роботов: одна и та же модель обучена работать сразу с несколькими типами роботизированных тел и задач, а не заточена под одну конкретную платформу. Заявленное превосходство над другими закрытыми и открытыми моделями сразу на трёх тестах пространственного восприятия, сигнал, что качество моделей для воплощённого ИИ продолжает расти, а масштабирование (три размера, от 2 до 122 млрд параметров) остаётся рабочим подходом и в робототехнике, а не только в языковых моделях.

Кому это важно

Разработчикам гуманоидных и других роботов, RynnBrain-VLA уже развёрнута на реальных платформах Unitree G1, Astribot S1 и Tianji-Wuji, то есть речь не только о лабораторных тестах. Исследователям воплощённого ИИ и VLA-моделей, новые бенчмарки и архитектурные решения (точки контакта, 3D-локализация, единое пространство действий для разных роботов) задают ориентир для конкурирующих разработок.

Как это применить

В источнике не указаны условия доступа к весам модели или лицензия, судя по тексту, речь о научной публикации с описанием архитектуры и результатов экспериментов, а не о готовом коммерческом продукте. Практическая ценность подхода, в замене отдельного обучения под каждую задачу и робота на совместное многозадачное и мультиплатформенное обучение: по данным авторов, это повышает долю успешных попыток по сравнению с обучением под одну задачу.

Можно ли доверять

Результаты, самоотчёт авторов исследования (первый указанный автор, Кехань Ли, вероятно, в составе более широкой команды соавторов), опубликованный как препринт/публикация на Hugging Face Papers; данных о независимой проверке или рецензировании в тексте нет. При этом заявления подкреплены не только бенчмарками, но и экспериментами на трёх реальных физических роботах разных типов, что снижает риск результатов, работающих только в симуляции.

Риски и подводные камни

Источник не раскрывает детали методологии тестов, размер выборок в экспериментах на реальных роботах и возможные неудачные случаи, судить о надёжности результатов вне представленных авторами цифр нельзя. Превосходство на трёх конкретных бенчмарках не гарантирует такого же качества на задачах и роботах, не вошедших в тестирование.