Google DeepMind представила Gemini 3.8 Live с Live Avatar, видеоаватаром в реальном времени

Google DeepMind представила Gemini 3.8 Live с Live Avatar, видеоаватаром в реальном времени

Google DeepMind анонсировала Gemini 3.8 Live с функцией Live Avatar, развитие модели живого диалога Gemini 3.8 Live, запущенной неделей ранее. Новая функция добавляет визуальное присутствие: система не только слушает и отвечает голосом, но и генерирует видео с динамическим персонажем почти в реальном времени, с точной синхронизацией губ, естественной мимикой и плавной сменой реплик в разговоре.

По заявлению компании, Live Avatar опирается на продвинутые возможности рассуждения Gemini и умеет асинхронно вызывать внешние инструменты и получать данные в фоновом режиме, не прерывая при этом активный диалог с пользователем, например, обрабатывать сложную задачу вроде заселения гостя в отель, пока разговор продолжается без пауз.

Функция поддерживает нативную многоязычную синхронизацию речи: мимика и синхронизация губ адаптируются под 97 языков, и, по утверждению DeepMind, переключение между языками происходит прямо в разговоре без потери качества видео и визуальных искажений.

Помимо набора готовых пресетов аватаров, организации могут создавать собственных, на основе эталонного изображения система генерирует полностью анимированного, отвечающего на реплики аватара с сохранением сходства, бренд-стиля или образа персонажа. Однако создание кастомных аватаров пока доступно только по индивидуальному разрешению (allowlisting) для корпоративных клиентов.

В вопросах доверия компания заявляет, что весь контент, сгенерированный её ИИ-продуктами, помечается невидимой водяной меткой SynthID, встроенной в аудио- и видеовыход, чтобы такой контент можно было отличить от настоящего и снизить риск дезинформации. Gemini 3.8 Live с Live Avatar уже доступна в Gemini Enterprise; разработчикам предлагается документация по API.

Ключевые факты

  • Google DeepMind выпустила Gemini 3.8 Live с Live Avatar, визуальным аватаром с синхронизацией губ и мимики почти в реальном времени, доступным уже в Gemini Enterprise
  • Функция умеет асинхронно вызывать инструменты и получать данные в фоне, не прерывая активный диалог с пользователем
  • Синхронизация речи и мимики работает на 97 языках, с бесшовным переключением между ними прямо во время разговора
  • Помимо готовых пресетов, доступно создание кастомных аватаров по образцу изображения, но пока только по allowlisting для корпоративных клиентов
  • Весь сгенерированный аудио- и видеоконтент помечается водяным знаком SynthID для отличия от настоящего

Почему это важно

Live Avatar переводит голосовые ИИ-ассистенты в формат с визуальным присутствием, это следующий шаг после чисто аудио-диалогов Gemini Live, запущенных неделей ранее, и попытка Google закрепиться в сегменте корпоративных виртуальных агентов с человекоподобным интерфейсом.

Кому это важно

В первую очередь корпоративным клиентам Gemini Enterprise, которые строят клиентскую поддержку, интерактивные демонстрации и сервисные сценарии (например, регистрацию гостей), а также разработчикам, создающим кастомных брендированных аватаров.

Как это применить

Функция уже доступна в Gemini Enterprise, а для интеграции разработчикам предлагается документация по API; создание собственных аватаров по эталонному изображению пока открыто только по индивидуальному разрешению компании (allowlisting), цены и условия подписки в анонсе не раскрыты.

Можно ли доверять

Заявления о качестве синхронизации на 97 языках, отсутствии визуальных искажений и работе асинхронных вызовов инструментов исходят исключительно от самой Google DeepMind в официальном блоге; независимых демонстраций, отзывов клиентов или технических деталей (архитектура, задержка) в источнике нет.

Риски и подводные камни

Технология генерации реалистичных говорящих видеоаватаров повышает риски злоупотреблений, подмены личности и дезинформации; Google указывает на встроенную маркировку SynthID как меру защиты, но независимой оценки её эффективности в материале не приводится, а доступ к кастомным аватарам сознательно ограничен allowlisting.

«Live Avatar может запускать вызовы инструментов и получать данные в фоновом режиме, продолжая активный диалог, справляясь со сложными задачами и обеспечивая непрерывный разговорный поток.»

— Google DeepMind, блог анонса