Роботы-гуманоиды вроде Tesla Optimus: прорывы ИИ не изменят жизнь скоро

MIT Technology Review совместно с Aventine (некоммерческим исследовательским фондом) опубликовал аналитический материал о том, почему яркие прогнозы вокруг гуманоидных роботов опережают реальность. Это не сообщение о новом результате, а разбор спора в отрасли. Текст источника в нашем распоряжении обрывается на середине статьи, поэтому пересказан только видимый фрагмент.
Отправная точка, Tesla Optimus. Илон Маск, глава Tesla, считает, что этот робот станет «не просто крупнейшим продуктом Tesla, но, вероятно, крупнейшим продуктом вообще», сначала на заводах, потом в домах. По его словам, сказанным акционерам в июле, со временем у Optimus появится «человеческая, а затем сверхчеловеческая ловкость». Маск утверждает, что такие роботы смогут автоматизировать почти весь человеческий труд, от переноски листового металла до складывания белья, по цене от $20 000 за штуку. В январе в Давосе он предположил, что роботы могут поступить в продажу широкой публике к концу 2027 года. В видеороликах же этот робот то танцует, передаёт попкорн, пылесосит и нажимает кнопку микроволновки, то падает назад, раздавая бутылки с водой, и с трудом гладит рубашку.
Маск не одинок. Марк Андрессен, сооснователь венчурной фирмы Andreessen Horowitz, говорил, что робототехника может стать «крупнейшей отраслью в истории планеты». Дженсен Хуанг, глава Nvidia, в январе заявил, что гуманоидные роботы в этом году сравняются с человеком по способностям. По оценке Morgan Stanley, число роботов, «похожих на людей и действующих как люди», вероятно, достигнет почти 1 млрд к 2050 году, а рынок превысит $5 трлн.
Эти заявления во многом держатся на идее, что те же достижения ИИ, что стоят за ChatGPT и Claude, позволят роботам имитировать человеческие движения так же, как чат-боты имитируют речь. Но многие робототехники скептичны: по их мнению, такие допущения преуменьшают сложность задачи, освоить бесконечное разнообразие физического мира с помощью интеллекта, построенного на тексте и изображениях. Ян Лекун, которого нередко называют одним из «крёстных отцов ИИ», сказал в Давосе: ни одна из компаний, делающих гуманоидов, «абсолютно не имеет понятия», как сделать этих роботов достаточно умными, чтобы они были полезны. Джонатан Хёрст из Agility Robotics отмечает, что сделать робота, похожего на человека, очень легко, а вот машину, которая движется и ведёт себя как человек, «драматически сложнее». Исследователи также предупреждают: смешивать гуманоидов (роботов человеческой формы) с универсальными машинами, способными учиться и выполнять разные задачи, заблуждение.
Что умеют сегодняшние лучшие «мозги» роботов. Авторы показывают это на примере ALOHA 2, установки из пары рук-манипуляторов, нескольких захватов и пары камер, которую исследователи Google DeepMind используют для проверки системы Gemini Robotics. Под управлением этой модели установка может, например, собрать ланч-бокс: положить ломтик белого хлеба в пакет Ziploc, закрыть его, переложить виноград в контейнер, закрыть крышку и застегнуть ланч-бокс. По оценке издания, это объективный шаг вперёд по сравнению с тем, что было возможно примерно три года назад.
Причина, изменение «политик» роботов, то есть того, как робот оценивает окружение, планирует движения и выполняет задачу. Раньше инженеры жёстко прописывали их в коде. Теперь их всё чаще отдают продвинутым ИИ-системам. Сначала это были VLM (модели «зрение, язык», обученные на изображениях и словах): показав такой модели пролитый кофе, можно попросить найти, чем убрать, и она укажет ближайшую тряпку. Затем появились VLA (модели «зрение, язык, действие»), добавившие команды движения: их обучают на изображениях и видео выполнения задачи вместе с данными о движении руки робота, обычно собранными телеуправлением. Gemini Robotics, VLA, обученная на множестве часов человеческих демонстраций; она может брать горошек щипцами, складывать оригами, собирать простой ланч. Но есть заметное ограничение: пока что робот под управлением VLA, получив задачу вне обучающего набора, с высокой вероятностью не справится. Эдвард Джонс, профессор робототехники Имперского колледжа Лондона, говорит: настоящая универсальная политика умела бы всё по всему спектру задач, а сегодняшняя модель Gemini Robotics способна лишь на «кое-что тут и кое-что там».
Стандартный ответ на вопрос, как расширить умения, больше данных. Google DeepMind, по словам Паннага Санкети, бывшего технического лидера направления робототехники в компании (сейчас он ведёт собственный проект по ИИ-робототехнике), хочет собрать «как можно больше данных». Но для роботов нет готового океана текстов, как для языковых моделей. Есть три пути, и у каждого свой изъян: нанимать людей для телеуправляемых демонстраций (дорого и долго), обучать VLA на видео с людьми (низкое качество данных), выпускать роботов в реальный мир и доучивать модели на их опыте (вне лабораторий роботы небезопасны и ненадёжны). Санкети считает наиболее вероятным «многосторонний» подход, сочетающий все источники.
Однако идея, что дело только в данных, далеко не общепринята. Хёрст называет её «принципиально ошибочной посылкой»: реальные задачи быстро разрастаются в сложности, на кухне нет двух одинаковых помещений, кофемашины работают по-разному, для чашек нужны разные захваты, а молоко, кофе и кипяток требуют разного обращения. Чтобы добиться универсальности через VLA, по его словам, потребовалось бы «полное покрытие данными всего, что робот когда-либо мог бы делать», то есть почти бесконечный набор. Лекун отвергает подход целиком: методы, успешные для языка, «не работают для высокоразмерных, непрерывных, зашумлённых данных», а значит, «нужно использовать что-то другое».
Главный претендент на это «другое», так называемая модель мира: ИИ, обученный меньше на тексте и больше на сочетании видео, трёхмерных сканов и данных датчиков и предназначенный предсказывать последствия действий в реальном мире. Если обучать роботов в симуляциях, достаточно точных по физике, разработка станет быстрее, дешевле и безопаснее, а роботы смогут рассуждать об окружении и заранее оценивать последствия действия. Над технологией работают Nvidia и Google, а деньги инвесторов идут в громкие стартапы: World Labs (сооснователь, исследовательница из Стэнфорда Фэй-Фэй Ли) привлекла $1 млрд в феврале, а в конце сентября её купила AMD за $8,2 млрд; AMI Labs, сооснованная Лекуном (ранее, главным учёным по ИИ в Meta), привлекла $1 млрд в марте. Но, по признанию самих участников, пока ещё ранний этап: Ли в конце прошлого года назвала область «зарождающейся» («foundational approaches are still being established», фундаментальные подходы ещё формируются), а в июньской записи в Substack описала серьёзные трудности. Дальше текст в нашем распоряжении обрывается.
Ключевые факты
- Маск утверждает, что Optimus может автоматизировать почти весь человеческий труд по цене от $20 000 за робота и поступить в продажу к концу 2027 года; Хуанг в январе заявил, что гуманоиды в этом году сравняются с человеком; Morgan Stanley оценивает число человекоподобных роботов к 2050 году почти в 1 млрд, рынок, свыше $5 трлн.
- Многие робототехники сомневаются, что методы, давшие ChatGPT и Claude, справятся с физическим миром: Лекун говорит, что ни одна из компаний-гуманоидов «не имеет понятия», как сделать роботов достаточно умными.
- Лучшие нынешние модели вроде Gemini Robotics (VLA) умеют, например, собрать ланч-бокс на установке ALOHA 2, но задачу вне обучающего набора, скорее всего, провалят.
- Три способа добыть данные для обучения роботов (телеуправление, видео людей, реальная эксплуатация) имеют изъяны; Хёрст из Agility Robotics считает ставку только на данные «принципиально ошибочной».
- Ведущая альтернатива, модели мира: World Labs привлекла $1 млрд в феврале и была куплена AMD за $8,2 млрд в конце сентября, AMI Labs Лекуна привлекла $1 млрд в марте; Ли называет область «зарождающейся».
Почему это важно
Прогнозы о гуманоидных роботах звучат от глав Tesla и Nvidia и подкрепляются оценками Morgan Stanley (почти 1 млрд роботов к 2050 году и рынок свыше $5 трлн), поэтому влияют на ожидания рынка и инвесторов. Материал показывает, на какой гипотезе они держатся: что методы, давшие чат-ботов, можно перенести на роботов. Часть исследователей считает такой перенос недооценкой сложности физического мира. Авторы при этом не отрицают прогресс: сегодняшние модели умеют то, что три года назад было недоступно, а в отрасли верят в возможность столь же глубокой революции, хотя о сроках спорят.
Кому это важно
Тем, кто следит за робототехникой и ИИ: инженерам и исследователям (спор о данных против моделей мира), инвесторам и аналитикам, которые читают прогнозы вроде оценок Morgan Stanley, а также обычным читателям, видевшим ролики с Optimus и решающим, насколько им верить.
Как это применить
Практически материал работает как фильтр для громких заявлений. Стоит различать гуманоидную форму и универсальность: умение выполнять много разных задач не следует из человекоподобного облика. Стоит спрашивать, на каком наборе задач и данных робота показали, и не вышла ли демонстрация за пределы обучающего набора: именно там, по статье, VLA с высокой вероятностью ошибаются. Следить имеет смысл за моделями мира: их развивают Nvidia и Google, а стартапы вроде World Labs и AMI Labs привлекают крупные деньги.
Можно ли доверять
Материал опубликован MIT Technology Review совместно с Aventine, некоммерческим исследовательским фондом. Это аналитический текст, а не отчёт о новом эксперименте; цифры Маска, Хуанга и Morgan Stanley приведены как их заявления и оценки. Видимый нам текст обрывается на середине статьи, поэтому заключительные выводы авторов не учтены. Скептические мнения принадлежат названным людям (Лекун, Хёрст, Джонс), в то время как Санкети выступает за подход с несколькими источниками данных.
Риски и подводные камни
Статья не называет сроков, когда универсальные гуманоиды могут стать полезными: сказано лишь, что робототехники расходятся во времени. Вопрос о том, продаётся ли Optimus клиентам, в видимом тексте не освещён, перечислены лишь ролики с удачами и провалами. Модели мира на ранней стадии: сама Фэй-Фэй Ли называет область «зарождающейся» и описывает серьёзные трудности. Сумма сделок (World Labs, AMI Labs) показывает интерес инвесторов, но не доказывает, что подход сработает для роботов.
«Сделать робота, который выглядит как человек, очень легко. Гораздо сложнее сделать машину, которая движется или ведёт себя динамически и физически как человек.»
— Джонатан Хёрст, сооснователь и главный по роботам (chief robot officer) Agility Robotics, профессор робототехники Орегонского государственного университета
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.