HumanCLAW: ни одна из девяти VLM не прошла тест на управление телом

Исследователи во главе с Сыяо Ли представили HumanCLAW, фреймворк для оценки того, способна ли модель "зрение-язык" (VLM, vision-language model) управлять физическим телом. Проблема, которую решает работа: когда робот с VLM внутри проваливает задачу, непонятно, кто виноват, сама модель приняла неверное решение или подвела моторика тела (например, потеряло равновесие и упало). HumanCLAW разделяет эти два слоя. На каждом шаге готовая VLM (её не переобучают) выдаёт только атомарную команду-навык, а её исполнение, доля секунды непрерывного движения всего тела с реальной физикой (гравитация, столкновения), берёт на себя отдельный контроллер. Так из результата убирают шум от неудачной моторики и измеряют именно "интеллект действия" модели, способность момент за моментом выбирать, что телу делать дальше.
На основе этого фреймворка авторы собрали HumanCLAW-Bench, 1218 длинных эпизодов от первого лица типа "найти-дойти-взаимодействовать" в 41 помещении. На этом бенчмарке протестировали девять современных VLM, и ни одна не решила задачу целиком: лучшая модель добралась лишь до 16,8% успешных прохождений. При этом узнать нужный объект для моделей не проблема, трудность в другом. Авторы делают вывод, что современным VLM не хватает воплощённого самосознания (embodied self-awareness): модели теряют собственное тело, не могут понять, где оно находится, добралось ли до цели или уже врезалось в препятствие.
Ключевые факты
- HumanCLAW, фреймворк, который разделяет решения VLM и физическое исполнение движений телом, чтобы оценивать чисто "интеллект действия" модели
- На каждом шаге готовая VLM выдаёт только атомарную команду-навык; её переводит в движение отдельный контроллер с реальной физикой (гравитация, столкновения)
- HumanCLAW-Bench: 1218 длинных эпизодов "найти-дойти-взаимодействовать" от первого лица в 41 помещении
- Протестировали девять современных VLM, ни одна не решила бенчмарк, лучший результат, 16,8% успешных эпизодов
- Причина провалов не в распознавании цели, а в отсутствии у моделей воплощённого самосознания: они теряют собственное тело в пространстве
Почему это важно
До сих пор было трудно понять, почему робот с VLM внутри проваливает задачу: виновата ли сама модель, принявшая неверное решение, или подвела моторика тела (потеряло равновесие, столкнулось с препятствием). HumanCLAW впервые разводит эти два слоя, решение и исполнение, и позволяет измерить именно способность модели управлять действием, без шума от неудачной механики. Результат неожиданно низкий: лучшая из девяти протестированных моделей справляется лишь в 16,8% случаев, и причина не в том, что модели не узнают нужный объект, а в том, что они теряют собственное тело в пространстве, не понимают, где оно, дошло ли до цели, врезалось ли во что-то.
Кому это важно
Разработчикам робототехники и воплощённого ИИ (embodied AI), которые строят системы, где VLM управляет физическим телом или манипулятором. Командам, создающим большие VLM (OpenAI, Google, Anthropic и другие), бенчмарк показывает конкретное слепое пятно текущих моделей. Исследователям, работающим над оценкой ИИ-агентов в физическом мире, а не только в тексте или изображениях.
Как это применить
HumanCLAW-Bench можно использовать как отдельный диагностический тест перед тем, как встраивать VLM в реального робота с моторикой: он проверяет чисто способность принимать решения о действии, до того как накладываются ошибки движения. Низкий результат на бенчмарке, сигнал, что модели пока не готовы к автономному управлению телом в длинных многошаговых сценариях, и что усилия стоит направить на воплощённое самосознание модели, а не только на точность распознавания сцены.
Можно ли доверять
Работа, препринт, опубликованный на Hugging Face Papers, набрал 26 отметок и 3 комментария; методология (разделение решения и исполнения, физически корректный симулятор, 1218 эпизодов в 41 сцене, девять протестированных моделей) описана подробно и выглядит воспроизводимой инженерной постановкой эксперимента, а не рекламным анонсом. Публикация ещё не прошла независимое рецензирование в журнале или на конференции.
Риски и подводные камни
Бенчмарк построен на симуляции с виртуальными телами и сценами, перенос выводов на реальных физических роботов и реальные помещения ещё предстоит проверить отдельно. Результат актуален для протестированных на момент публикации девяти моделей; более новые VLM могут показать другие цифры уже в ближайшее время. Само определение "воплощённого самосознания" вводится авторами внутри этой работы и пока не является общепринятым стандартом измерения.