Google DeepMind выпустила Gemini Robotics 2 для управления всем телом робота

Google DeepMind представила Gemini Robotics 2, набор из трёх ИИ-моделей, которые служат «слоем интеллекта» для физических роботов: Gemini Robotics 2, Gemini Robotics ER 2 и Gemini Robotics On-Device 2.
Gemini Robotics 2, самая продвинутая VLA-модель компании (vision-language-action, «зрение-язык-действие»): она превращает зрительный и языковой ввод в управление моторикой и умеет управлять целыми гуманоидами, от стоп до кончиков пальцев, а не только верхней частью тела, как прежние модели DeepMind. В демонстрации модель управляла гуманоидом Apollo 2 производства Apptronik: получив команду «положи лейку в зелёный контейнер на нижней полке», робот подошёл к столу, взял лейку, прошёл к полкам и точно поставил её на место.
Модель также продвинулась в тонкой моторике. Она управляет пятипалой рукой SharpaWave с 22 степенями свободы, установленной на Apollo 2, и способна выполнять деликатные действия, завязывать узлы, застёгивать пакет с зип-локом. На платформе Franka Duo та же модель управляет стандартным двупалым захватом-грипером и справляется со сложными задачами вроде плотной упаковки предметов.
Gemini Robotics ER 2, модель воплощённого рассуждения (embodied reasoning, ER), выступающая «высокоуровневым мозгом» робота: она общается с человеком, оценивает обстановку в комнате, планирует многошаговые задачи и координирует работу VLA-модели, отслеживая прогресс до завершения задачи. В новой версии модель стала надёжнее выполнять длинные последовательности действий продолжительностью в несколько минут и сотни решений, точнее определяет начало и конец задачи и момент наступления ключевых событий. Также впервые заявлена поддержка совместной работы нескольких роботов разных типов над одной сложной задачей.
Gemini Robotics On-Device 2, самая эффективная VLA-модель линейки, оптимизированная для работы локально на самом роботе без сети и интернета. Она изначально рассчитана на разные типы тел (multi-embodiment) и наследует технику «переноса движений» из Gemini Robotics 1.5: адаптация под новую двурукую конструкцию робота занимает всего несколько часов и обычно требует менее 200 примеров, даже если форма, сенсоры и степени свободы нового робота сильно отличаются от прежних. Это подтвердили на платформах Dexmate, SO101 и Trossen.
Отдельно DeepMind вводит новый бенчмарк безопасности ASIMOV-Agentic, который проверяет способность модели-«агента» отказываться от небезопасных команд, поступающих от VLA-модели, оценивать выполнимость задачи и вовремя просить о помощи человека. По заявлению компании, Gemini Robotics ER 2, самая безопасная её робототехническая модель на сегодня по бенчмаркам соблюдения ограничений безопасности и работы рядом с людьми: она лучше распознаёт приближение человека и может остановить робота, если тот подошёл слишком близко.
По доступности: Gemini Robotics ER 2 уже доступна в Google AI Studio и находится в приватном превью на платформе Gemini Enterprise Agent Platform. Модели Gemini Robotics 2 (VLA) и Gemini Robotics On-Device 2 пока доступны только партнёрам с ранним доступом.
Ключевые факты
- Три новые модели: Gemini Robotics 2 (VLA, управляет всем телом гуманоида), Gemini Robotics ER 2 (планирование, общение с людьми, координация нескольких роботов) и Gemini Robotics On-Device 2 (компактная VLA для локальной работы на роботе)
- Гуманоид Apollo 2 (Apptronik) впервые под управлением Gemini Robotics 2 выполнил задачу целым телом: по голосовой команде подошёл к столу, взял лейку, дошёл до полок и поставил её в нужный контейнер
- Новый уровень тонкой моторики: пятипалая рука SharpaWave с 22 степенями свободы завязывает узлы и застёгивает зип-лок пакет, двупалый грипер Franka Duo справляется с плотной упаковкой
- Gemini Robotics On-Device 2 адаптируется к новому двурукому роботу за несколько часов и менее чем на 200 примерах, даже если форма и сенсоры сильно отличаются от прежних тел
- Новый бенчмарк безопасности ASIMOV-Agentic проверяет отказ модели от небезопасных команд и умение вовремя просить о помощи человека; ER 2 уже доступна в Google AI Studio, VLA и On-Device модели, только партнёрам раннего доступа
Почему это важно
До сих пор модели DeepMind для роботов управляли в основном верхней частью тела для задач на столе. Gemini Robotics 2 впервые распространяет управление на всё тело гуманоида, ходьбу, приседания, дотягивание и манипуляции одновременно, а не как отдельные заученные последовательности движений. Одновременно с этим появляется возможность координировать несколько роботов разных типов над одной задачей. Сама DeepMind называет релиз важной вехой на пути к «решению AGI в физическом мире», то есть к переходу от узкоспециализированной автоматизации к роботам общего назначения.
Кому это важно
В первую очередь, компаниям и исследователям, разрабатывающим гуманоидных и промышленных роботов: в демонстрациях уже участвуют Apptronik (гуманоид Apollo 2), Franka Duo (двупалый грипер) и платформы Dexmate, SO101 и Trossen. Также релиз касается разработчиков, которые получат доступ к Gemini Robotics ER 2 через Google AI Studio, и корпоративных клиентов, которым интересна связка с Gemini Enterprise Agent Platform. Для конечных пользователей робототехники, складов, производств, в перспективе дома, это шаг к роботам, которые выполняют составные задачи по обычной речевой инструкции, а не по жёсткой программе.
Как это применить
Прямо сейчас Gemini Robotics ER 2 (модель рассуждения) доступна в Google AI Studio и в приватном превью на Gemini Enterprise Agent Platform, то есть разработчики уже могут подключить её к собственным сценариям планирования и координации задач. Модель Gemini Robotics 2 (VLA, управление движением) и компактная Gemini Robotics On-Device 2 пока закрыты и доступны только партнёрам с ранним доступом; инструкции по переносу моделей на своё оборудование DeepMind публикует в отдельном блоге для разработчиков. Дата публичного релиза VLA- и On-Device-моделей и их стоимость в источнике не указаны.
Можно ли доверять
Источник, официальный блог Google DeepMind, то есть все цифры и оценки (степени свободы, время адаптации, число примеров, характеристики безопасности) идут от самой компании и не подтверждены независимыми тестами. Часть цифр приведена приблизительно («несколько часов», «менее 200 примеров», «сотни решений»), без точных значений. Прямого количественного сравнения с предыдущей моделью Gemini Robotics 1.5 в источнике нет, прогресс описан словами, а не измерен. Список из более чем 200 авторов работы указывает на масштаб внутренней команды, но сам по себе не заменяет независимую проверку заявлений.
Риски и подводные камни
Ключевые модели, Gemini Robotics 2 (VLA) и Gemini Robotics On-Device 2, пока не в открытом доступе, а только у партнёров, поэтому независимо проверить заявленные возможности сейчас нельзя. DeepMind сама признаёт, что скорость движений роботов пока требует доработки. Заявления о безопасности (новый бенчмарк ASIMOV-Agentic, статус «самой безопасной модели на сегодня»), это внутренняя самооценка компании, без данных о внешнем аудите. Наконец, в источнике не указаны ни дата широкого релиза, ни цена моделей, что затрудняет оценку, когда и на каких условиях эти возможности станут доступны за пределами партнёрской программы.