14 причин, почему создать по-настоящему умного робота так сложно

14 причин, почему создать по-настоящему умного робота так сложно

Автор указывает на разрыв между прогрессом ИИ в интеллектуальном труде и в физическом. У знаниевой работы есть ChatGPT, продукт, который может опробовать любой человек. У человекоподобных роботов такого аналога нет: их прогресс виден почти исключительно по демонстрационным роликам из тестовых лабораторий, а это ненадёжный источник, ролик может показывать единственную удачную попытку из ста, сценарий может быть подобран так, чтобы обойти нерешённые задачи, а монтаж с большим числом склеек может создавать иллюзию скорости и надёжности, которой на самом деле нет. Отдельно упоминаются недавние World Humanoid Robot Games: там меньше возможности для выборочного показа лучших кадров, и наряду с впечатляющими результатами там же было много явных провалов.

Далее в тексте разобран список конкретных технических барьеров. Ловкость рук: человеческая кисть имеет около двух десятков степеней свободы и порядка 17 000 тактильных рецепторов; отдельные роборуки достигают до 27 степеней свободы или содержат тысячи тактильных датчиков в одном пальце, но ни одна не сочетает гибкость, чувствительность, силу и надёжность одновременно, а задача управления рукой (спланировать хват сложного предмета, сложить рубашку, перевернуть омлет, среагировать на смещение мягкого материала) может быть не менее сложной, чем сама механика. Зрение: несмотря на успехи компьютерного зрения, распознавание объекта в загромождённой сцене, определение точки хвата и безопасного места для шага остаются нерешёнными. Планирование и реакция: робот должен разбивать задачу на шаги и перестраивать план при неожиданностях, застрявшем болте, испорченном продукте, ребёнке, выбежавшем на кухню. Понимание задачи: у языковых моделей было огромное количество текста для обучения, книги, веб-страницы; для физических навыков сопоставимого по масштабу массива данных нет, и роботу ещё нужно получать контекст вроде того, где лежат припасы или какой уровень помощи нужен конкретному человеку.

Остальные барьеры: кооперация, сегодняшние ИИ-агенты работают изолированно, а роботам придётся координироваться друг с другом и с людьми в меняющейся обстановке; скорость, нынешние роботы двигаются заметно медленнее человека, что снижает и полезность, и безопасность; сила, сочетать мощность с приемлемым весом и манёвренностью трудно, а мощные моторы сильнее греются и быстрее сажают батарею; мобильность, нерешён спор колёса против ног (колёса дешевле и устойчивее, ноги нужны для лестниц и препятствий, но повышают риск падения); безопасность, в отличие от беспилотного автомобиля, который в нештатной ситуации может просто остановиться, у постоянно двигающегося робота нет простого «безопасного стоп-кадра», а внезапное замирание может уронить предмет с плиты или человека, которому робот помогал идти; выносливость, сегодняшние двуногие роботы обычно работают несколько часов до подзарядки (автор не считает это главной проблемой, решения вроде замены батарей или зарядных полов найдутся), но всерьёз мешает перегрев: робот размером с человека выделяет примерно вдвое больше тепла, чем сам человек, а естественного механизма отвода тепла вроде потоотделения у него нет; наконец, обобщение на нестандартные ситуации, по мнению автора, самая трудная задача из всех. Пример: автомобили Waymo проехали более 220 млн миль, это в 250 раз больше, чем среднестатистический американец проезжает за всю жизнь, и всё равно попадали в новости из-за заезда на затопленную дорогу и над горящими фейерверками; а роботам, работающим в домах и офисах, придётся сталкиваться с гораздо большим разнообразием задач, инструментов и обстановки, чем автомобилю на дороге.

Последний из перечисленных барьеров, вычислительная мощность: чтобы одновременно и быстро делать всё перечисленное выше (ловкость, зрение, планирование, кооперация) с достаточной надёжностью, нужно много вычислений. На этом месте доступный фрагмент текста обрывается, заголовок эссе обещает 14 причин, но окончание раздела про вычисления и, судя по всему, ещё один-два пункта в собранный текст не попали.

Ключевые факты

  • Эссе перечисляет технические барьеры на пути к по-настоящему автономным человекоподобным роботам и предупреждает: демо-ролики, плохой способ судить о прогрессе, потому что их легко подобрать и смонтировать выигрышно.
  • Человеческая кисть, около двух десятков степеней свободы и порядка 17 000 тактильных рецепторов; лучшие роборуки достигают 27 степеней свободы, но ни одна не сочетает гибкость, чувствительность, силу и надёжность одновременно.
  • Для физических задач нет аналога того массива текстовых данных, на котором обучались языковые модели, это тормозит обучение роботов контексту и здравому смыслу.
  • Робот размером с человека выделяет примерно вдвое больше тепла, чем сам человек, а типичный запас хода двуногих роботов, несколько часов до подзарядки.
  • Автомобили Waymo проехали свыше 220 млн миль (в 250 раз больше, чем среднестатистический американец проезжает за жизнь) и всё равно попадали в затопленные дороги и на горящие фейерверки, пример того, что редкие ситуации остаются проблемой даже для куда более простой задачи, чем работа человекоподобного робота дома.

Почему это важно

Вокруг человекоподобных роботов в кругах ИИ-энтузиастов ходят прогнозы об «экономическом взрыве», когда роботы начнут не только выполнять физический труд, но и производить себе подобных. Автор указывает на разрыв между этой картиной и реальностью: судить о прогрессе почти не по чему, кроме постановочных демо-роликов, а не по продукту, который можно опробовать самому, как ChatGPT. Эссе даёт структурированный список того, что именно ещё не решено, противовес хайпу, построенному на эффектных кадрах.

Кому это важно

Инженерам и исследователям в робототехнике, как чек-лист нерешённых задач; инвесторам и аналитикам, которые оценивают стартапы человекоподобных роботов и питчи с обещаниями скорого запуска; журналистам и всем, кто хочет трезво читать очередной вирусный ролик с роботом, а не принимать эффектный монтаж за готовый продукт.

Как это применить

Автор прямо предлагает практику: при просмотре очередного впечатляющего ролика с роботом задавать себе вопрос, какие из перечисленных способностей, ловкость рук, зрение, планирование, понимание контекста, кооперация, скорость, сила, мобильность, безопасность, выносливость, устойчивость к нестандартным ситуациям, вычислительная мощность, робот действительно продемонстрировал, а какие сценарий демонстрации мог обойти стороной.

Можно ли доверять

Материал, авторское аналитическое эссе в блоге на Substack (secondthoughts.ai), имя автора в доступном тексте не указано. На Hacker News пост набрал 69 голосов и 30 комментариев, заметный, но не экстраординарный отклик. Конкретные примеры (роборуки с 27 степенями свободы, тысячи тактильных датчиков в пальце) приведены без названий компаний-источников. Это рассуждение практика/наблюдателя, а не рецензируемое исследование, ценность в структуре и постановке вопросов, а не в первичных данных.

Риски и подводные камни

Список читается как исчерпывающий разбор, но заявленных в заголовке 14 причин в доступном фрагменте текста меньше, материал обрывается на разделе про вычислительную мощность, и финальные пункты в выборку не попали. Часть примеров (характеристики роборук) не привязана к конкретным компаниям и продуктам, так что их нельзя проверить по первоисточнику. Общая рамка эссе, личная оценка одного автора, а не консенсус отрасли.

«Проблема управления рукой может быть не менее сложной, чем проблема её физического устройства.»

— автор эссе (имя не указано в доступном тексте)