WCM: новая модель-критик учит роботов-манипуляторов предсказывать будущее

Дообучение vision-language-action (VLA) моделей методами обучения с подкреплением (RL post-training), многообещающий подход для управления роботами-манипуляторами. В таких системах критик, компонент, который оценивает, насколько хорошо текущее состояние или действие ведёт к цели, обычно опирается на один кадр наблюдения или один срез скрытых признаков VLA-модели. Авторы указывают, что это фундаментально не соответствует природе управления роботом: задача частично наблюдаема, то есть по одному кадру нельзя восстановить всю нужную информацию о происходящем.
Простое решение, добавить критику историю прошлых наблюдений, не работает по двум причинам: вычислительная сложность растёт экспоненциально вместе с размерностью визуального пространства, а обучение только через регрессию скалярной суммарной награды (return) не даёт критику достаточно сигнала, чтобы он уловил, как состояние меняется во времени. По мнению авторов, корень проблемы, в приближении состояния: без явной цели моделировать мир представление критика просто не способно закодировать временную структуру, нужную для точной оценки.
Чтобы решить это, авторы предложили World Critic Model (WCM), критика, построенного на облегчённой архитектуре LeJEPA. WCM решает две задачи одновременно: предсказывает будущее скрытое состояние среды и оценивает value (ценность) текущего состояния или действия. За счёт этого представление критика вынужденно улавливает динамику во времени, а не просто подгоняется под итоговое число награды. WCM встраивается и в on-policy, и в off-policy конвейеры обучения и совместим с современными VLA-бэкбонами, Pi0, Pi0.5 и OpenVLA-OFT.
В экспериментах на 149 задачах из четырёх бенчмарков, как внутри распределения обучающих данных, так и за его пределами, WCM стабильно показал наилучший результат среди сравниваемых методов, с особенно сильным приростом в обобщении на новые условия. Дополнительно метод проверили на семи задачах с реальными роботами-манипуляторами, используя OpenVLA-OFT и Pi0.5 в режиме off-policy обучения с подкреплением, развёртывание оказалось стабильным в разных условиях. Источник не приводит конкретных числовых показателей превосходства над базовыми методами, не называет авторов или организацию и не поясняет, что представляет собой архитектура LeJEPA, помимо того, что она лёгкая и лежит в основе WCM.
Ключевые факты
- WCM, новая архитектура критика для RL-обучения VLA-моделей роботов-манипуляторов, построена на облегчённой архитектуре LeJEPA
- Критик одновременно предсказывает будущее скрытое состояние среды и оценивает value, это решает проблему частичной наблюдаемости, которая ломает однокадровые критики
- Наивное добавление истории наблюдений не работает: экспоненциальный рост сложности и слабый сигнал от одной лишь регрессии скалярной награды
- Совместим с VLA-бэкбонами Pi0, Pi0.5 и OpenVLA-OFT, встраивается и в on-policy, и в off-policy конвейеры обучения
- На 149 задачах из четырёх бенчмарков WCM показал лучший результат с сильным обобщением, а на семи задачах с реальными роботами, стабильное развёртывание
Почему это важно
В обучении роботов-манипуляторов с подкреплением критик обычно смотрит только на один кадр наблюдения или на один срез скрытых признаков VLA-модели. Управление роботом, задача с частичной наблюдаемостью: по одному кадру часто невозможно понять, что произошло раньше и что произойдёт дальше, поэтому такой критик даёт неточную оценку. Авторы показывают, что простое добавление истории наблюдений проблему не решает: вычислительная сложность растёт экспоненциально с ростом визуального пространства, а обучение критика через одну лишь регрессию скалярной награды не даёт достаточно сигнала, чтобы модель уловила временную структуру. WCM устраняет это, обучая критика одновременно предсказывать будущее скрытое состояние среды и оценивать value, то есть заставляет представление критика явно улавливать динамику во времени, а не просто подгоняться под число.
Кому это важно
Разработчикам и исследователям, которые обучают роботов-манипуляторов на VLA-моделях (Pi0, Pi0.5, OpenVLA-OFT и подобных) методами обучения с подкреплением: WCM встраивается и в on-policy, и в off-policy конвейеры без переделки архитектуры. Значимо это и для команд, которые сталкиваются с проблемой частичной наблюдаемости в других задачах RL с визуальным входом, где однокадровый критик даёт слабую оценку.
Как это применить
WCM построен на облегчённой архитектуре LeJEPA и добавляется поверх существующего критика: вместо одной головы, которая просто регрессирует значение, критик получает вторую задачу, предсказать будущее скрытое состояние. Авторы протестировали связку с тремя современными VLA-бэкбонами, Pi0, Pi0.5 и OpenVLA-OFT, и показали совместимость с обоими режимами обучения, on-policy и off-policy. В тексте источника нет ни ссылки на код, ни данных о лицензии, ни инструкции по внедрению, только описание архитектуры и результаты экспериментов.
Можно ли доверять
Результаты получены на 149 задачах из четырёх бенчмарков, как внутри распределения обучающих данных, так и за его пределами, и WCM стабильно показывает наилучший результат, особенно в обобщении на новые условия. Дополнительно метод проверен на семи задачах с реальными роботами-манипуляторами (на OpenVLA-OFT и Pi0.5, в режиме off-policy), и развёртывание оказалось стабильным в разных условиях. При этом в тексте источника нет ни имён авторов, ни принадлежности к организации, ни конкретных числовых показателей превосходства над базовыми методами, только формулировка «наилучший результат» без цифр, поэтому независимо оценить масштаб улучшения по этому тексту нельзя.
Риски и подводные камни
Источник не раскрывает, насколько именно WCM превосходит базовые критики в цифрах, заявлено только качественное превосходство и «сильное обобщение», без чисел. Не объясняется, что представляет собой архитектура LeJEPA, кроме того, что она облегчённая и лежит в основе WCM. Неизвестны авторы и организация, стоящие за работой, а также нет данных о том, прошла ли работа рецензирование, доступен ли код и насколько результаты воспроизводимы за пределами описанных бенчмарков.