Google представила AgentHands, ИИ-агента с синхронными жестами рук в XR

Команда Google XR представила AgentHands, исследовательский прототип, который добавляет ИИ-агентам синхронизированные с речью жесты рук в расширенной реальности (XR). Работа опубликована на конференции CHI 2026 и продолжает более ранние проекты команды Human I/O и Sensible Agent. Авторы блог-поста, Сюнь Цянь (Xun Qian), научный сотрудник Google XR, и Жуфэй Ду (Ruofei Du), руководитель направления интерактивного восприятия и графики; сама исследовательская работа выполнена прежде всего Цзыи Лю (Ziyi Liu) во время его работы студентом-исследователем в Google, при участии Дэвида Ли (David Li), Чжунъи Чжоу (Zhongyi Zhou) и Дэвида Кима (David Kim), а также под стратегическим руководством Адарша Кауди (Adarsh Kowdle), Гуру Сомаддера (Guru Somadder) и Шахрама Изади (Shahram Izadi).
Авторы отталкиваются от того, что ассистенты вроде Project Astra и Gemini 3.1 Flash Live уже позволяют обсуждать окружение в реальном времени, накладывая на видео с камеры 2D-рамки вокруг объектов. Для плоского экрана это работает, но в иммерсивных системах вроде Android XR такой подход не создаёт по-настоящему воплощённого, пространственного диалога, этот разрыв авторы и называют «mental mapping gap» (разрыв в мысленной привязке к пространству). Чтобы его закрыть, команда сначала провела формирующее исследование с XR- и HCI-экспертами Google, выясняя, что делает виртуальную руку «читаемой» в 3D-среде, и на основе этого построила таксономию жестов.
AgentHands состоит из нескольких модулей. Модуль регистрации объектов с помощью взгляда пользователя и реконструкции сцены позволяет «пометить» предмет, например, орхидею или ноутбук, так, что он попадает в пространственный реестр в виде 3D bounding box, на который агент может ссылаться. Библиотека жестов разбита на три семантические категории: дейктические (указательные, для отсылки к объекту), иконические (изображающие форму предмета или действие) и экспрессивные (передающие эмоции и социальные сигналы). Когда пользователь задаёт вопрос, LLM формирует ответ, в который встроены события жеста (GestureEvent), привязанные к конкретным словам-триггерам в тексте. Локальный парсер на XR-гарнитуре по временным меткам слов синхронизирует синтез речи (TTS) с анимацией, так что жесты агента совпадают с произносимыми словами.
Авторы приводят три сценария применения. В обучающем сценарии по уходу за орхидеей агент не просто говорит «проверьте корни», он подводит руки к основанию растения и обводит воздушные корни, поясняя их функцию. В техническом сценарии с 3D-принтером агент демонстрирует последовательность «повернуть и нажать» для навигации по ручкам управления и выбора файлов. В сценарии бытового сопровождения агент выступает в роли wellness-коуча и может выполнить предупреждающий жест, взять пользователя за руку вместе с визуальным эффектом, чтобы предостеречь от нездорового поведения.
Эффект проверили во внутригрупповом исследовании с 12 участниками: AgentHands сравнили с версией того же ассистента, где были только реплики без жестов, при идентичном заранее прописанном тексте. Участники выполнили две процедурные задачи, сочетающие бытовой уход и техническую операцию. По словам авторов, результаты подтвердили, что сочетание XR и синхронных с речью жестов эффективно для пространственно привязанного взаимодействия, но конкретные цифры (баллы, проценты, величина эффекта) в источнике не приводятся.
Команда продолжает развивать прототип для экосистемы Android XR и в дальнейшем планирует персонализировать жесты, например, подстраивать их под ведущую руку пользователя или под его индивидуальные пространственные привычки. Даты релиза или условий коммерческой доступности в источнике нет.
Ключевые факты
- AgentHands, исследовательский прототип Google XR, представленный на CHI 2026: он добавляет ИИ-агентам жесты рук, синхронизированные с речью, для пространственно привязанного общения в XR.
- Система «регистрирует» реальные предметы (орхидею, ноутбук) через взгляд пользователя и реконструкцию сцены, превращая их в 3D bounding box, на которые агент может ссылаться жестом.
- Жесты делятся на три категории, дейктические (указательные), иконические (изображающие действие или форму) и экспрессивные; LLM встраивает события жеста в ответ, а локальный парсер на гарнитуре синхронизирует их с синтезом речи по временным меткам слов.
- Во внутригрупповом исследовании с 12 участниками AgentHands сравнили с версией без жестов на двух процедурных задачах; авторы заявляют об эффективности жестов, но конкретных цифр не приводят.
- Работу вёл прежде всего студент-исследователь Цзыи Лю под стратегическим руководством Адарша Кауди, Гуру Сомаддера и Шахрама Изади; развитие продолжается в рамках Android XR, даты релиза нет.
Почему это важно
Ассистенты вроде Project Astra и Gemini 3.1 Flash Live уже умеют обсуждать физическое окружение через 2D-рамки на видео с камеры, но для иммерсивных XR-систем такого плоского наложения недостаточно, оно не создаёт ощущения, что агент действительно присутствует в пространстве рядом с пользователем. AgentHands, это попытка Google закрыть именно этот разрыв: превратить абстрактные словесные инструкции ИИ в физическую демонстрацию руками, синхронизированную с речью и привязанную к конкретным предметам в комнате пользователя.
Кому это важно
В первую очередь, разработчикам приложений для Android XR и других XR/AR-платформ, которые строят ассистентов для физических задач: обучающие и туториальные сценарии, техническую поддержку по оборудованию, бытовых и wellness-помощников. Также это интересно исследователям в области human-computer interaction, которые занимаются мультимодальными агентами и воплощённым (embodied) взаимодействием человека с ИИ.
Как это применить
Авторы описывают три готовых сценария использования: интерактивное обучение уходу за растением (агент руками показывает и поясняет, что делать с корнями), технический разбор работы 3D-принтера (агент демонстрирует последовательность действий с ручками управления) и бытовое сопровождение в роли wellness-коуча (агент берёт пользователя за руку, чтобы предостеречь от нежелательного действия). Всё это остаётся исследовательским прототипом: в источнике нет ни публичного API, ни коммерческого продукта, ни даты выпуска, практическое применение пока ограничено демонстрацией концепции внутри экосистемы Android XR.
Можно ли доверять
Источник, официальный блог Google Research с указанием конкретных авторов (Сюнь Цянь, Жуфэй Ду) и ссылкой на публикацию на профильной конференции CHI 2026, что говорит в пользу достоверности описания системы. При этом эффективность жестов подтверждена только словесно, авторы сообщают, что результаты исследования с 12 участниками «подтвердили» пользу жестов, но не публикуют ни одной конкретной цифры (баллов, процентов, величины эффекта), поэтому проверить масштаб эффекта по самому посту невозможно.
Риски и подводные камни
Выборка исследования, всего 12 участников, что типично для лабораторного HCI-исследования, но не позволяет судить о том, как эффект жестов масштабируется на разных людей и задачи. Отсутствие опубликованных цифр не даёт оценить, насколько велик выигрыш от жестов по сравнению с обычной речью. Сценарий wellness-коуча, где агент физически «берёт пользователя за руку», чтобы предостеречь от действия, поднимает вопросы о степени физического вмешательства ИИ-ассистента в поведение человека, источник не раскрывает, как это будет регулироваться на практике. Наконец, прототип привязан к экосистеме Android XR и пока не имеет ни даты выпуска, ни подтверждённых планов коммерциализации.