Учёные разложили 77 систем обучения роботов на «веса» и «навыки»

Обзор систематизирует область обучения роботов вокруг одного разлома: политики, которые зашивают умения в замороженные веса нейросети (модели «зрение-язык-действие», VLA), против агентов, которые сами пишут и дорабатывают исполняемые навыки в виде кода.
Центральный вклад работы, разбор методов «код как политика» по степени самоулучшения: от одноразового (zero-shot) синтеза программы, через замкнутый цикл самопочинки и устойчивую память навыков, до редко занятой ячейки, где обратная связь по исполнению, память навыков и эволюционный поиск сходятся в единый открытый цикл. Эту ячейку занимают лишь немногие совсем новые системы, например, ASPIRE, ENPIRE и RoboClaw.
Отдельно разобран противоположный полюс, «навыки»: от обучения с подкреплением без учителя, открывающего навыки самостоятельно, до библиотек навыков на основе больших языковых моделей. Показано, что слово «навык» в поле используется как минимум в пяти разных смыслах, и только смысл «навык-как-код» способен самоулучшаться без обновления градиентов.
Далее таксономия связывается с формирующейся «экономикой навыков»: коммерческие маркетплейсы навыков для роботов уже распространяют их в один клик между разными роботами, но пока поставляют только статичное воспроизведение записанного, это выводит на поверхность нерешённые задачи: адаптацию навыка под новые условия, переносимость между разными «телами» роботов, отслеживание происхождения навыка, проверку безопасности, композицию навыков друг с другом и стандартизацию.
Обзор намеренно сфокусированный, а не исчерпывающий: разобраны 77 представительных систем из шести семейств техник через одну таксономию и набор сравнительных таблиц; для каждого механизма самоулучшения даны операциональные определения и явно указано, чего каждое семейство методов делать не умеет.
Ключевые факты
- Обзор делит подходы к обучению роботов на два полюса: «веса» (VLA-модели, зашивающие умения в веса нейросети) и «навыки» (агенты, пишущие и правящие исполняемый код).
- Методы «код как политика» разложены по степени самоулучшения: от одноразового синтеза программ через замкнутый цикл самопочинки и устойчивую память навыков до редкой ячейки, где обратная связь по исполнению, память навыков и эволюционный поиск сходятся в единый открытый цикл, её занимают лишь немногие совсем новые системы, например ASPIRE, ENPIRE и RoboClaw.
- Слово «навык» используется как минимум в пяти разных смыслах, и только смысл «навык-как-код» самоулучшается без обновления градиентов.
- Коммерческие маркетплейсы навыков для роботов уже распространяют навыки в один клик, но поставляют пока лишь статичное воспроизведение, открытыми остаются адаптация, переносимость между разными роботами, происхождение, проверка безопасности, композиция и стандартизация.
- Обзор фокусированный: разобраны 77 систем из шести семейств техник через одну таксономию и сравнительные таблицы, даны операциональные определения механизмов самоулучшения и явно указано, чего не умеет каждое семейство.
Почему это важно
Обучение роботов сейчас развивается двумя параллельными путями, «зашить умение в веса» и «научить агента писать код-навык самому», и у сообщества до сих пор не было общего языка, чтобы сравнивать их напрямую. Обзор впервые сводит оба направления в одну таксономию с операциональными определениями, что превращает разрозненные системы в сопоставимую карту подходов и делает видимым, где именно проходит граница между статичной компетенцией и способностью к самоулучшению.
Кому это важно
Прежде всего это важно исследователям и инженерам робототехники и ИИ-агентов, которые выбирают архитектуру для нового проекта, а также командам, которые строят или оценивают коммерческие библиотеки и маркетплейсы навыков для роботов, обзор напрямую разбирает открытые проблемы именно этого рынка.
Как это применить
Таксономия даёт инженеру систему координат: если задаче нужна предсказуемая, статичная компетенция, ближе полюс «веса» (VLA-модели); если нужна способность адаптироваться и наращивать умения на лету, ближе полюс «навыки», и дальше уже стоит выбор степени самоулучшения, от одноразового синтеза кода до полного открытого цикла с памятью и эволюционным поиском. Для тех, кто оценивает готовые коммерческие решения по обмену навыками роботов, обзор даёт готовый чек-лист вопросов: как навык адаптируется под новые условия, переносится ли между разными роботами, можно ли отследить его происхождение, проверена ли его безопасность, как он комбинируется с другими навыками и есть ли стандарт.
Можно ли доверять
Это фокусированный обзор с чёткой методологией: 77 представительных систем сгруппированы в шесть семейств по единой таксономии, с операциональными определениями механизмов самоулучшения и явным указанием ограничений каждого семейства, такая структура типична для добросовестного академического обзора. В доступном тексте не указаны ни авторы, ни организация, ни место и дата публикации, поэтому независимо оценить репутацию авторов по самому тексту нельзя. На момент попадания в подборку материал успел набрать скромное внимание, 6 отметок и 2 комментария.
Риски и подводные камни
Сам обзор честно указывает на главный риск текущего состояния поля: коммерческие маркетплейсы уже продают и распространяют навыки роботов, но фактически поставляют лишь статичное воспроизведение записанного, а вопросы адаптации, переносимости между разными роботами, отслеживания происхождения навыка, проверки безопасности, композиции и стандартизации остаются нерешёнными, это значит, что покупка «навыка» для робота сегодня не гарантирует ни его безопасности, ни переносимости на другую платформу. Есть и методологический риск: обзор сознательно сфокусирован на 77 представительных системах, а не исчерпывающий, поэтому за его рамками могут остаться значимые подходы, не попавшие в выборку.
«Коммерческие маркетплейсы навыков для роботов уже распространяют навыки в один клик между роботами, но поставляют пока лишь статичное воспроизведение записанного.»
— из текста обзора