Pelican-Sim 1.0: модель мира для роботов подняла успешность выполнения задач с 70% до 93%

Pelican-Sim 1.0: модель мира для роботов подняла успешность выполнения задач с 70% до 93%

Исследователи представили Pelican-Sim 1.0, «модель мира» (world model) общего назначения для воплощённого ИИ (embodied intelligence: ИИ, который управляет физическими роботами). Модель предсказывает будущие наблюдения сцены по её текущему видео и последовательности действий робота и предназначена для того, чтобы поддерживать последующее обучение и принятие решений при управлении роботом, например, дообучение и оценку стратегий управления без обязательного прогона на реальном оборудовании.

Авторы выделяют четыре архитектурных решения. Во-первых, унифицированное представление действий: 28-мерное пространство значений действий охватывает большинство распространённых типов роботов, так что одна и та же модель остаётся валидной для разнородных устройств вместо отдельной модели под каждый тип робота. Во-вторых, внедрение действий в видеоряд: мост между командами действий и пикселями строится через видео действий, часть которых рендерится по URDF-модели робота (стандартное описание его кинематики), а часть снимается камерой; по данным авторов, это заметно повышает управляемость модели в разных типах роботов, сценах и задачах, метрика PSNR (чем выше, тем ближе сгенерированное видео к реальному) выросла на 0,904 пункта по сравнению с альтернативными способами объединения действий и изображения. В-третьих, разреженная смесь экспертов (MoE): такие слои добавляют модели «ёмкость» под разнородную динамику разных роботов и поглощают модальность действий, снижая конфликт между модальностями, показатель FVD (метрика качества генерации видео, чем ниже, тем лучше) при этом снизился на 6,530 пункта по сравнению с обычной плотной (не разреженной) версией модели. В-четвёртых, эффективная генерация прогона: каузальная адаптация и дистилляция до малого числа шагов дали четырёхшаговый авторегрессионный симулятор, который работает в 5,67 раза быстрее версии, которой требовалось 35 шагов.

Модель обучили примерно на одном миллионе траекторий, реальных и симулированных. На бенчмарках это дало прирост метрики PSNR относительно лучших сравниваемых моделей: на 4,636 пункта на AgiBotWorld Beta, на 2,080, на RoboMIND и на 10,343, на RoboTwin; адаптированная авторами оценка DYN (часть набора метрик EWMBench) на RoboTwin выросла на 0,426 пункта. Конкретные названия моделей, с которыми сравнивают Pelican-Sim 1.0, в тексте не приводятся, они фигурируют только как «альтернативные способы объединения действий и изображения», «плотная базовая модель» и «сильнейшие из проверенных базовых моделей».

На бенчмарке RoboTwin авторы проверили четыре прикладных сценария применения модели, и все четыре, по их словам, дали заявленный эффект. В сценарии аугментации данных добавление 500 траекторий, сгенерированных Pelican-Sim 1.0, к 50 демонстрациям на задачу подняло успешность выполнения задачи роботом с 70% до 93%. В сценарии оценки уже обученной стратегии управления (без прогона на реальном роботе) корреляция Пирсона между оценкой модели и фактическим качеством стратегии достигла 0,994 по пяти контрольным точкам обучения. Ещё в двух сценариях, выбор действия и улучшение уже обученной стратегии управления, относительный прирост успешности достиг соответственно 47,7% и 20,3%. Отдельно авторы отмечают качественную генерализацию модели при смене траектории, сцены, объекта, типа робота и ракурса камеры и говорят, что это подчёркивает потенциал Pelican-Sim 1.0 стать универсальным симулятором общего назначения, но не заявляют, что такая универсальность уже доказана.

Ключевые факты

  • Pelican-Sim 1.0, модель мира (world model) для воплощённого ИИ: по видео сцены и действиям робота предсказывает, как сцена будет выглядеть дальше; обучена примерно на одном миллионе реальных и симулированных траекторий.
  • Четыре архитектурных решения: унифицированное 28-мерное пространство действий под разные типы роботов; видео-мост между действиями и пикселями, часть кадров рендерится по URDF-модели робота, часть снимается камерой (PSNR +0,904 пункта к альтернативным способам объединения); разреженная смесь экспертов, MoE (FVD -6,530 пункта к плотной базовой модели); дистилляция до четырёхшагового авторегрессионного симулятора, ускорение в 5,67 раза против 35-шаговой версии.
  • На бенчмарках PSNR выше лучших сравниваемых моделей на 4,636 пункта (AgiBotWorld Beta), 2,080 (RoboMIND) и 10,343 (RoboTwin); адаптированная оценка DYN из набора метрик EWMBench на RoboTwin выросла на 0,426 пункта.
  • Четыре прикладных сценария на RoboTwin: аугментация данных (500 сгенерированных траекторий плюс 50 демонстраций на задачу подняли успешность выполнения задачи роботом с 70% до 93%), оценка стратегии управления (корреляция Пирсона 0,994 по пяти контрольным точкам), выбор действия (относительный прирост успешности 47,7%) и улучшение стратегии управления (20,3%).
  • Все прикладные результаты получены только в симуляции на RoboTwin, без проверки на физических роботах; имена авторов, организации, число параметров и планы релиза кода или весов модели в тексте не указаны; вывод о «потенциале» универсального симулятора авторы формулируют как потенциал, а не как доказанный факт.

Почему это важно

Обучать и проверять стратегии управления роботом на реальном оборудовании дорого, медленно и рискованно: каждая неудачная попытка тратит время и может повредить технику. Модель мира решает эту проблему тем, что учится предсказывать, как сцена будет выглядеть дальше в ответ на действия робота, и позволяет проверять варианты виртуально, без физического робота. Проблема в том, что типов роботов много и они разные (руки-манипуляторы, шасси, гуманоиды), обучать отдельную модель мира под каждый дорого, а полноценный многошаговый прогон симуляции, медленный. Pelican-Sim 1.0 отвечает на оба вопроса сразу: единое 28-мерное представление действий делает одну модель применимой к разным типам роботов, а дистилляция до четырёх шагов ускоряет прогон в 5,67 раза. Результат не остаётся чисто архитектурным: на бенчмарке RoboTwin добавление сгенерированных моделью траекторий подняло успешность выполнения задачи роботом с 70% до 93%, заметный прирост от чисто синтетических данных.

Кому это важно

Исследователям и инженерам в робототехнике и воплощённом ИИ, которые обучают стратегии управления роботами и упираются в стоимость и риск сбора данных на реальном оборудовании. Командам, которые работают сразу с несколькими типами роботов, руками-манипуляторами, гуманоидами, мобильными платформами, и вынуждены сегодня держать отдельную модель под каждый: единое пространство действий снимает часть этой избыточности. Авторам бенчмарков и метрик для моделей мира и агентов в робототехнике, Pelican-Sim 1.0 даёт ещё одну точку сравнения на AgiBotWorld Beta, RoboMIND и RoboTwin. Отдельная аудитория, команды, которым нужна оценка стратегии управления без прогона на реальном роботе: заявленная корреляция Пирсона 0,994 с фактическим качеством стратегии обещает именно это.

Как это применить

Pelican-Sim 1.0, исследовательский прототип, а не готовый продукт: в тексте не упомянуты ни код, ни веса модели, ни условия доступа или лицензия. Практическую ценность такой модели мира авторы показывают на четырёх сценариях поверх уже существующего процесса обучения робота: пополнять обучающие данные сгенерированными траекториями в дополнение к дорогим демонстрациям на реальном роботе; оценивать качество обученной стратегии управления без физического прогона; выбирать следующее действие по прогнозу модели; дообучать (улучшать) уже готовую стратегию. Все четыре сценария в отчёте проверены только на симулированном бенчмарке RoboTwin, а не на физических роботах, это стоит учитывать при переносе выводов на реальное оборудование.

Можно ли доверять

Источник, технический отчёт на HuggingFace Papers; в доступном тексте не названы ни имена авторов, ни организации, ни дата публикации, ни число параметров модели или вычислительный бюджет обучения (поле «author» в карточке источника, служебные метаданные загрузки, а не атрибуция из текста самого отчёта). Все цифры в отчёте, самостоятельно заявленные авторами результаты: сравнение идёт с базовыми моделями, которые в тексте не названы по имени, а обозначены только описательно («альтернативные способы объединения действий и изображения», «плотная базовая модель», «сильнейшие из проверенных базовых моделей»). AgiBotWorld Beta, RoboMIND и RoboTwin, независимые от авторов бенчмарки, но результаты на них авторы получают и публикуют сами, без независимой проверки. Заявление о «потенциале» универсального симулятора авторы прямо формулируют как потенциал, а не как уже доказанный факт.

Риски и подводные камни

Все четыре прикладных результата, аугментация данных, оценка, выбор действия, улучшение стратегии, получены только в симуляции на бенчмарке RoboTwin; переноса на физических роботов в тексте нет, а поведение синтетических данных на реальном оборудовании может отличаться. Сравнение идёт с обезличенными базовыми моделями («альтернативные способы объединения», «плотная базовая модель»), а не с конкретными конкурирующими моделями по именам, что затрудняет независимую сверку места Pelican-Sim 1.0 среди других решений. В тексте не указаны ни число параметров, ни вычислительный бюджет обучения, ни планы по публикации кода или весов модели, воспроизвести результат по одному только отчёту не получится. Наконец, вывод о потенциале Pelican-Sim 1.0 как универсального симулятора общего назначения авторы делают по качественным наблюдениям генерализации при смене траектории, сцены, объекта, типа робота и ракурса камеры, а не по отдельному количественному тесту на новых, не встречавшихся при обучении роботах.