InterEvolve: языковая модель подбирает награды для гуманоида Unitree G1 без переобучения

InterEvolve: языковая модель подбирает награды для гуманоида Unitree G1 без переобучения

В статье предложен метод InterEvolve для гуманоидных роботов, которые должны не только ходить, но и работать с предметами (по-английски loco-manipulation, то есть перемещение с манипуляцией объектами). Задача, которую авторы ставят: решать то, чему контроллер никогда не обучали, повторно используя уже имеющиеся навыки, улучшаясь на собственных попытках и сохраняя выученное, причём без переобучения.

Ключевая идея авторов: широкий контроллер уже содержит значительную часть компетенции, нужной для новой задачи. Остаётся добраться до неё через интерфейс между планированием и управлением. По замыслу авторов, он должен быть достаточно выразительным, чтобы описывать многоэтапные взаимодействия с контактом, и в то же время исполнимым и измеримым, чтобы обратная связь от выполнения помогала планированию учиться на опыте.

InterEvolve реализует этот интерфейс из двух компонентов. Первый, объектно-ориентированная (object-aware) фундаментальная модель поведения типа «вперёд, назад» (forward-backward, FB). Её поправки на объекты (object residuals) поверх замороженной модели тела превращают новую награду, относящуюся к телу или предметам, в поведение робота прямо во время работы, без дообучения.

Второй компонент, задачи, записанные как «программы вознаграждения»: поэтапные награды с условиями завершения этапов и настраиваемыми константами. Агент на основе большой языковой модели переписывает структуру такой программы в контексте, опираясь на обратную связь от выполнения и библиотеку навыков из проверенных программ, а числовой оптимизатор подбирает константы. Каждый кандидат проверяется в параллельных симуляционных сценариях. Так программа находит новые способы вызвать, переиспользовать и скомбинировать уже имеющиеся двигательные умения контроллера и улучшается от итерации к итерации.

По утверждению авторов, эксперименты показывают: награды, разработанные людьми, оставляют значительную часть способностей FB-модели к такой работе нереализованной, а эволюционировавшие программы InterEvolve её раскрывают, иногда с помощью новых стратегий. В симуляции метод даёт поведение для разных задач, сложных сцен и длинных последовательностей из нескольких задач. Выработанные навыки автономно работают на реальном роботе Unitree G1 по данным бортового восприятия «от первого лица» (egocentric).

Ключевые факты

  • InterEvolve учит гуманоида новым задачам во время работы (test-time), без переобучения контроллера: переиспользует имеющиеся навыки, учится на собственных попытках и сохраняет выученное.
  • Задача записывается как программа вознаграждения: поэтапные награды с условиями завершения и настраиваемыми константами. Структуру программы переписывает агент на основе большой языковой модели, константы подбирает числовой оптимизатор.
  • Основа метода, объектно-ориентированная FB-модель поведения с поправками на объекты поверх замороженной модели тела; каждый кандидат проверяется в параллельных симуляционных сценариях.
  • По утверждению авторов, награды, написанные людьми, оставляют значительную часть возможностей FB-модели неиспользованной, а эволюционировавшие программы раскрывают её, иногда новыми стратегиями.
  • Сложные сцены и длинные последовательности задач показаны в симуляции; автономная работа выработанных навыков по бортовому восприятию от первого лица, на реальном Unitree G1.

Почему это важно

Обычно для новой задачи гуманоида приходится заново обучать контроллер или вручную писать функцию вознаграждения. Авторы предлагают другой путь: считать, что широкий контроллер уже умеет многое, и подбирать лишь «программу вознаграждения», которая вытаскивает нужное умение наружу. Если это работает так, как описано, то новые задачи можно осваивать без переобучения, за счёт перебора и проверки программ в симуляции.

Кому это важно

Исследователям гуманоидной робототехники и обучения с подкреплением, особенно тем, кто работает с фундаментальными моделями поведения, а также командам, которые пытаются использовать большие языковые модели для автоматического проектирования наград. Практический интерес представляет демонстрация на реальной платформе Unitree G1.

Как это применить

Это научная статья, и в описании не упомянуты ни код, ни набор данных, поэтому готового инструмента для применения здесь нет. Идею можно взять как схему: задача записывается как поэтапная программа вознаграждения, языковая модель правит её структуру по обратной связи и библиотеке проверенных программ, числовой оптимизатор настраивает константы, а все кандидаты сначала проверяются в параллельной симуляции.

Можно ли доверять

Все утверждения о результатах, слова самих авторов в аннотации к статье. Количественных показателей (доли успехов, числа итераций, числа задач) в тексте нет, размер преимущества над наградами, написанными людьми, не измерен в цифрах («значительная часть» способностей). Какая именно языковая модель использовалась и какие задачи выполнял реальный Unitree G1, в тексте не названо.

Риски и подводные камни

Сложные сцены и длинные последовательности задач описаны только для симуляции; на реальном роботе показана автономная работа выработанных навыков, но без численной оценки. Метод опирается на заранее обученную FB-модель: он раскрывает уже имеющиеся способности контроллера, а не добавляет принципиально новые. Каждый кандидат требует проверки в симуляции, так что цена и скорость такого перебора по тексту оценить нельзя.

«Широкий контроллер уже содержит значительную часть компетенции, нужной для новой задачи.»

— авторы статьи об InterEvolve