Google DeepMind выпустила Gemini Robotics ER 2 для роботов

Google DeepMind выпустила Gemini Robotics ER 2, новую версию модели «воплощённого рассуждения» (embodied reasoning) для роботов, апгрейд предыдущей Gemini Robotics ER 1.6. Модель работает как «мозг верхнего уровня»: она понимает физический мир, планирует многошаговые задачи, общается с человеком и вызывает инструменты (например, Google Search или произвольные пользовательские функции), а исполнение движений передаёт нижестоящей модели vision-language-action (VLA). Ключевое отличие от прошлой версии, модель анализирует непрерывный видеопоток, а не отдельные снимки: это позволяет роботу отслеживать собственный прогресс, замечать сбои и самостоятельно корректировать действия по ходу выполнения задачи. Также впервые представлена функция совместной работы нескольких роботов (multi-robot collaboration): разные машины, например, колёсный робот и гуманоид, могут через общее семантическое понимание разделять между собой этапы сложной задачи. Модель уже публично доступна разработчикам через Gemini API и Google AI Studio, а на платформе Gemini Enterprise Agent Platform работает в режиме закрытого превью. DeepMind ввела два новых замера способности модели понимать прогресс задачи по видео: классификация прогресса (робот относит каждый кадр к одному из пяти уровней выполнения, 0, 20%, 20, 40%, 40, 60%, 60, 80%, 80, 100%), где точность составила 57,4%, и поиск ключевого момента (точное определение кадра, где происходит критическое событие, например момент, когда пора прекратить наливать кофе в чашку) с точностью 91,3% и средним отклонением 0,96 секунды, при этом модель работает в 4 раза быстрее гораздо более крупных моделей сопоставимого класса. Компания также улучшила базовые способности пространственного мышления: обнаружение успеха и сбоя теперь работает по видео, а не по статичным снимкам (замечает разливы, проскальзывания, смещения по ходу выполнения); чтение приборов расширено с круглых шкал и смотровых стёкол до цифровых дисплеев, линейных шкал, линеек и жидкостных термометров, модель протестировали на 10 разных типах приборов; улучшено визуальное понимание вопросов и ответов (VQA). DeepMind называет Gemini Robotics ER 2 своей самой безопасной моделью на сегодняшний день: она заметно лучше проходит тесты на следование инструкциям безопасности и на дистанцию до человека, в частности, останавливает гуманоидного робота, когда рядом оказывается человек, и возобновляет работу только после того, как зона освобождается. Для оценки безопасности физических агентов DeepMind вводит отдельный бенчмарк, проверяющий способность модели соблюдать ограничения безопасности, следить за обстановкой, оценивать физическую выполнимость действия и запрашивать уточнение у человека. В качестве демонстрации DeepMind построила систему с роботом Spot от партнёра Boston Dynamics: Gemini Robotics ER 2 управляет API навигации и манипулятора Spot, и робот приносит предметы по голосовой команде, например, приносит попкорн. Совместную работу нескольких роботов показали на примере гуманоида Apollo 2 от Apptronik и робота Franka F3 Duo. Код демонстраций выложен на GitHub.
Ключевые факты
- Gemini Robotics ER 2, новая embodied-reasoning модель DeepMind для роботов, апгрейд Gemini Robotics ER 1.6; доступна через Gemini API и Google AI Studio, в закрытом превью на Gemini Enterprise Agent Platform
- Главное новшество, работа с непрерывным видео вместо снимков: классификация прогресса задачи по пяти уровням (точность 57,4%) и поиск ключевого момента события (точность 91,3%, отклонение 0,96 с, в 4 раза быстрее гораздо более крупных моделей)
- Впервые появилась совместная работа нескольких роботов (multi-robot collaboration), показана на связке гуманоида Apollo 2 (Apptronik) и робота Franka F3 Duo
- Расширены базовые тесты пространственного мышления: обнаружение сбоев по видео, чтение 10 типов приборов, улучшенное VQA
- DeepMind называет модель самой безопасной из своих: она останавливает робота при появлении человека рядом и вводит новый бенчмарк безопасности для VLA-оркестрации; демонстрация, робот Spot (Boston Dynamics), выполняющий команды по навигации и манипуляции
Почему это важно
Это очередной шаг DeepMind в развитии «мозга» для роботов, модели, которая не управляет моторикой напрямую, а рассуждает о задаче, планирует шаги и передаёт исполнение нижестоящим VLA-моделям. Главное отличие новой версии, переход от анализа отдельных кадров к пониманию непрерывного видео: это даёт роботу возможность самому отслеживать прогресс, замечать сбои и продолжать работу без перезапуска всей задачи. Вторая новинка, совместная работа нескольких разнотипных роботов над одной задачей, которой не было в предыдущей версии.
Кому это важно
Разработчикам робототехнических систем и стартапам, которые строят агентов поверх VLA-моделей и API управления роботами; компаниям вроде Boston Dynamics и Apptronik, чьи роботы уже фигурируют в демонстрациях DeepMind; исследователям в области embodied AI, которым интересны новые бенчмарки по пониманию прогресса задачи и безопасности физических агентов.
Как это применить
Gemini Robotics ER 2 доступна разработчикам через Gemini API и Google AI Studio уже сейчас, на платформе Gemini Enterprise Agent Platform, в закрытом превью. Разработчик описывает низкоуровневые интерфейсы управления (VLA-модели, навигационные API) как инструменты для модели и передаёт в неё видео, аудио или текст напрямую; для задач, чувствительных к задержке, модель интегрирована с Gemini Live API, двунаправленным потоковым интерфейсом, который позволяет роботу «думать» о следующем шаге, одновременно выполняя текущий, без пауз «стоп-и-подумай». Примеры кода и демонстраций DeepMind выложила на GitHub.
Можно ли доверять
Материал, официальный блог-пост Google DeepMind, то есть все цифры и оценки (57,4% точности классификации прогресса, 91,3% точности и 0,96 с отклонения при поиске момента, четырёхкратное ускорение), самостоятельно заявленные компанией результаты внутренних тестов, без независимой проверки. В источнике не названы ни конкретные модели-конкуренты, с которыми сравнивали ER 2, ни их собственные показатели, сравнение приведено в общем виде («предыдущие и конкурирующие передовые модели»).
Риски и подводные камни
В посте не раскрыты ни стоимость доступа к API, ни сроки перехода Gemini Enterprise Agent Platform из закрытого превью в общий доступ. Заявления о безопасности (самая безопасная модель DeepMind, остановка при появлении человека) опираются на собственный новый бенчмарк компании, а не на независимый аудит. Автор поста не назван, материал опубликован от лица DeepMind в целом.