Generalist AI научила роботов новым задачам с одного видео

Автор рассылки Wired «AI Lab» Уилл Найт побывал в офисе стартапа Generalist AI в Кембридже (штат Массачусетс, США) и увидел, как роборуки справляются с бытовыми задачами, складывают чашки стопкой, раскладывают кубики по мискам. Его поразило, как быстро роботы разбираются в незнакомом действии: манера напомнила ему поведение живого человека. Роборуки осваивали задачи, посмотрев короткое обучающее видео, и без отдельной тренировки под конкретное действие.
Два примера того, как роботы импровизируют. Робота попросили смести кубик в миску совком и щёткой; когда щётку убрали со стола, робот сам решил использовать совок как щётку и просто смахнул кубик в миску. В другом случае двурукий робот посмотрел видео, где человек расстёгивает сумочку и вынимает банкноты, и повторил то же самое с другой сумкой. Когда дотянуться до денег одним захватом не получилось, робот сам переключился с правого захвата на левый, чтобы зайти под другим углом; стоявший рядом инженер компании удивился, раньше робот так не делал.
CEO и сооснователь Generalist AI Пит Флоренс сравнил впечатление от увиденного с реакцией на модель OpenAI GPT-3, которая вышла в 2020 году: тогда, по его словам, людей восхищало именно то, что модель можно было просто попросить сделать что-то новое, и у неё был реальный шанс справиться. Похожий принцип компания переносит на роботов, обучая их интуитивному пониманию физики мира, тому чувству, с которым дети с раннего возраста осваиваются в окружающей обстановке. Иногда роботы удивляют самих исследователей: в одном случае робот, перед которым положили банан, сам решил смести им мусор, как щёткой.
На встрече с автором статьи Флоренса сопровождал Эндрю Барри, сооснователь и технический директор компании; третий сооснователь и главный научный сотрудник, Энди Цзэн. Все трое ранее вместе работали в Google DeepMind и Boston Dynamics над одними из самых продвинутых робототехнических моделей и оборудования (кто именно из троих работал в какой из двух компаний, в статье не уточняется).
Традиционный подход к обучению роботов требует «скармливать» модели тысячи примеров под каждую отдельную задачу, и результат получается хрупким: робот может сбиться даже от смены освещения. Generalist, по словам основателей, идёт другим путём, компания делает ставку на единую модель для роботов, которую обучают люди: они надевают специальные перчатки-захваты с камерами и вручную выполняют бытовые действия. Автор статьи видел ящик с несколькими сотнями таких перчаток, готовых к отправке работникам в Мексику и другие страны. Флоренс и его команда не раскрывают точный рецепт обучения моделей, но утверждают, что уже собрали большой объём качественных данных; в отличие от некоторых конкурентов, свои модели компания строила полностью с нуля, а не на основе готовой языковой модели с открытым кодом.
Независимые эксперты подтверждают серьёзность подхода. Робототехник Технологического института Джорджии Данфэй Сюй говорит, что Generalist «довели идею до предела» и «отлично справились с исполнением»; по его оценке, компания собрала огромный массив качественных данных, а её команда, «первоклассные робототехники», которые занимаются «настоящей хорошей наукой». То, что компания уже показала, добавляет он, говорит о её нацеленности на реальное коммерческое применение роботов, Generalist, по его словам, «ближе всего к тому, что можно по-настоящему развернуть в деле». Робототехник Стэнфордского университета Карен Лю описывает подход Generalist так: компания собирает данные о физическом взаимодействии в большом масштабе, не привязывая их слишком жёстко к одному конкретному роботу, и, по её словам, «судя по самым сильным результатам компании, эта ставка, похоже, срабатывает».
В самой Generalist признают: надёжность пока далека от идеала. В среднем робот успешно справляется с уже показанной ему задачей примерно в 59% случаев, при том, что желаемый ориентир основатели видят где-то выше 99%. Насколько эти навыки распространяются на незнакомые задачи и обстановку, тоже остаётся неясным, сам источник называет это «неясным». Показательный эпизод: поздним вечером один из инженеров компании просто ради интереса начал составлять чашки стопкой на столе перед двуруким роботом, тот присоединился сам, начал хватать и составлять в стопку другие чашки, а когда закончил, обрадованный инженер закричал от восторга.
Ключевые факты
- Стартап Generalist AI из Кембриджа (штат Массачусетс) показал роботов, которые осваивают новые задачи после одного короткого обучающего видео, без отдельной тренировки под конкретное действие.
- Роботы импровизируют: один сам заменил недостающую щётку совком и смахнул кубик в миску, другой сам переключился с правого захвата на левый, чтобы дотянуться до банкнот в сумке, такого от него раньше не видели даже инженеры компании.
- Успешность пока ограниченная: в среднем робот справляется с уже показанной ему задачей примерно в 59% случаев при желаемом ориентире основателей, выше 99%; насколько навыки переносятся на незнакомые задачи и обстановку, остаётся неясным.
- Все три сооснователя, CEO Пит Флоренс, технический директор Эндрю Барри и главный научный сотрудник Энди Цзэн, ранее вместе работали в Google DeepMind и Boston Dynamics; свои модели компания строит с нуля на данных, которые снимают камеры на специальных перчатках-захватах, автор видел ящик с несколькими сотнями таких перчаток, готовых к отправке работникам в Мексику и другие страны.
- Независимые робототехники, Данфэй Сюй (Технологический институт Джорджии) и Карен Лю (Стэнфордский университет), называют подход Generalist AI одним из самых серьёзных в отрасли, а Сюй считает его ближайшим к реальному коммерческому применению, хотя точный рецепт обучения моделей компания не раскрывает.
Почему это важно
CEO Generalist AI Пит Флоренс сам сравнивает увиденное с «моментом GPT-3» для роботов: раньше, чтобы научить робота новому действию, в модель приходилось закладывать тысячи примеров именно под эту задачу, и даже тогда всё ломалось от смены освещения. Здесь робот осваивает задачу после одного короткого видео и без отдельной тренировки, а иногда сам находит решение, которого от него не ждали: заменяет отсутствующую щётку совком, меняет захват, чтобы дотянуться до денег. Если такой перенос навыков действительно работает, это снимает один из главных барьеров физического ИИ, потребность в огромных объёмах данных под каждое отдельное движение, и приближает роботов общего назначения к реальным условиям вроде производства.
Кому это важно
Инвесторам и компаниям, которые следят за рынком робототехнических стартапов; производственным и логистическим бизнесам, которые присматриваются к гибкой автоматизации без переобучения модели под каждую отдельную операцию; исследователям, которые ищут способ научить ИИ физике мира и переносу навыков между задачами, так, как это получается у детей.
Как это применить
Готового продукта здесь нет: в статье не названы ни имя продукта, ни цена, ни сроки выхода, ни то, где и как роботов можно будет купить или арендовать. Generalist по-прежнему собирает обучающие данные через перчатки-захваты с камерами, которые носят люди, и не раскрывает точный рецепт обучения моделей. Для производственных и логистических команд это пока не то, что можно внедрить сегодня, а история, за которой стоит следить: по оценке стороннего эксперта, компания «ближе всего к тому, что можно по-настоящему развернуть в деле», то есть ближе других, но ещё не готова к развёртыванию.
Можно ли доверять
Автор, журналист рассылки Wired «AI Lab», описывает то, что видел лично, а не рекламный ролик, и в статье приводятся оценки двух независимых робототехников: Данфэй Сюй из Технологического института Джорджии и Карен Лю из Стэнфордского университета, оба подтверждают серьёзность подхода и данных Generalist. При этом ключевая цифра успеха, 59%, исходит от самой компании, а точный рецепт обучения моделей Флоренс и команда раскрывать отказываются, так что независимо проверить сами цифры со стороны нельзя.
Риски и подводные камни
Заявленные 59% успеха заметно ниже той планки (выше 99%), которую сами основатели называют целью, и источник прямо говорит: неясно, насколько навыки роботов переносятся на незнакомые задачи и обстановку за пределами показанных демонстраций. Компания держит в секрете точный рецепт обучения моделей, что мешает независимой проверке заявлений. Ни сроков выхода, ни названия продукта, ни коммерческих условий в материале нет, открытым остаётся сам вопрос, когда и в каком виде это дойдёт до реального внедрения.
«Именно это так восхищало людей в GPT-3, можно было просто попросить модель сделать что-то новое, и у неё был реальный шанс справиться.»
— Пит Флоренс, сооснователь и CEO Generalist AI