Google выпустила Gemini 3.8 Live, новые голосовые модели с рассуждением, приближённым к реальному времени

Google выпустила Gemini 3.8 Live, новые голосовые модели с рассуждением, приближённым к реальному времени

Google выпустила две новые модели семейства Gemini для голосовых ИИ-агентов: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе модели построены на рассуждении, приближённом к реальному времени, и должны сделать разговор с ИИ более естественным и «умным», и для разработчиков с компаниями, которые встраивают голосовых агентов в свои продукты, и для обычных пользователей Gemini, Google Workspace и Поиска.

Gemini 3.8 Live, базовая модель, рассчитанная на масштаб и экономичность. Она сочетает разговорный интеллект с плавным диалогом и визуальной привязкой к контексту: обрабатывает визуальные данные почти в реальном времени, автоматически распознаёт и переключается между 97 поддерживаемыми языками прямо посреди разговора, а также умеет выполнять вызовы инструментов и API в фоне, продолжая разговор, пока задача выполняется. По собственным данным Google, модель заняла второе место в рейтинге Speech Agent Arena и остаётся «высокоэффективной по стоимости», точных цифр по цене компания не привела.

Gemini 3.8 Live Extended Thinking, версия для сложных, многошаговых задач с повышенным интеллектом. По замерам Google, она заняла первое место в общем зачёте индекса Speech to Speech Quality Index агентства Artificial Analysis (82,6 балла), показала 68,6% на бенчмарке агентных задач τ-Voice и 35,1% на его банковском варианте τ-Voice-banking от Sierra, а также набрала 97,7% на тесте рассуждений Big Bench Audio. На EVA-Bench от ServiceNow, бенчмарке для оценки голосовых агентов, модели, по словам Google, «сдвигают границу Парето» для сложных сценариев работы, но сама компания уточняет: результат получен только в одной конфигурации, Live API на платформе Gemini Enterprise Agent Platform. Extended Thinking умеет рассуждать и говорить одновременно: модель использует вербальные фразы вроде «дайте я проверю…» (в оригинале, «Let me check that…»), чтобы естественно подтвердить получение запроса, и вслух проговаривает прогресс, пока выполняет многоэтапные фоновые задачи.

Обе модели доступны через Gemini Live API. Его уже используют платформы для разработчиков, Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, которые берут на себя сложную инфраструктуру потоковой передачи медиа в реальном времени и дают разработчикам сосредоточиться на пользовательском опыте, а не на инфраструктуре. Среди партнёров запуска Google называет Salesforce, Genspark и Lumeris, по словам компании, они отмечают впечатляюще низкую задержку, плавность взаимодействия и работу с вызовом инструментов у новых моделей.

Весь аудиоконтент, который генерируют модели, помечается незаметной меткой SynthID, встроенной прямо в аудиопоток. По формулировке Google, это должно помочь отличать сгенерированный ИИ звук от настоящего и снижать риск дезинформации.

Доступ к обеим моделям начал открываться в день анонса, но по-разному. Gemini 3.8 Live доступна разработчикам через Gemini API и Google AI Studio; компаниям, в закрытом предпросмотре Gemini Enterprise, а для направления Customer Experience, «скоро»; всем пользователям, через голосовой ввод в Search Live. Gemini 3.8 Live Extended Thinking доступна разработчикам через Gemini API и Google AI Studio; компаниям, тоже в закрытом предпросмотре Gemini Enterprise, а для Customer Experience и бизнес-клиентов Workspace, «скоро»; обычным пользователям, в приложении Gemini Live, плюс в Docs (в составе Workspace) для подписчиков Google AI Pro и Ultra, и в Gmail и Keep, для всех подписчиков Google AI.

Ключевые факты

  • Google выпустила две голосовые модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, с рассуждением, приближённым к реальному времени.
  • Extended Thinking заняла 1-е место в индексе Speech to Speech Quality Index (82,6) от Artificial Analysis, набрала 68,6% на τ-Voice, 35,1% на τ-Voice-banking от Sierra и 97,7% на Big Bench Audio.
  • Базовая Gemini 3.8 Live распознаёт и переключает 97 языков на лету, обрабатывает визуальный контекст почти в реальном времени и заняла 2-е место в Speech Agent Arena.
  • Модели доступны через Gemini Live API; его уже используют платформы Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents и партнёры запуска Salesforce, Genspark, Lumeris.
  • Доступ открылся в день анонса: разработчикам, через Gemini API и AI Studio, бизнесу, в закрытом предпросмотре Gemini Enterprise, пользователям, в Gemini Live, Search Live, а также в Workspace, Gmail и Keep для подписчиков Google AI.

Почему это важно

Голосовые ИИ-агенты, один из самых конкурентных фронтов индустрии, и их главная техническая проблема, задержка между «услышать», «подумать» и «ответить», из-за которой диалог с ИИ ощущается неестественным. Google выпускает сразу две модели, нацеленные именно на это: Extended Thinking умеет рассуждать и одновременно продолжать разговор, не замолкая на паузу «обдумывания», а базовая Live обрабатывает визуальный контекст и переключает языки прямо на лету, заявлено автоматическое распознавание 97 языков. По собственным данным Google, это даёт первое место в индексе Artificial Analysis и заметные результаты на других независимых бенчмарках голосовых агентов, у Sierra и ServiceNow, то есть компания говорит не об абстрактном улучшении, а об измеримом отрыве по конкретным метрикам.

Кому это важно

В первую очередь, разработчикам и компаниям, которые строят голосовых агентов: обе модели доступны через Gemini API и Google AI Studio, а для бизнеса, в закрытом предпросмотре Gemini Enterprise. Это касается и партнёрских платформ для потоковой голосовой инфраструктуры, Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, которые уже строят интерфейсы поверх Gemini Live API, а также компаний Salesforce, Genspark и Lumeris, названных партнёрами запуска. Обычным пользователям новые модели придут через голосовой ввод в Search Live и в приложении Gemini Live, а подписчикам Google AI Pro и Ultra, ещё и в Docs, а всем подписчикам Google AI, в Gmail и Keep.

Как это применить

Разработчик может подключить любую из моделей уже сегодня через Gemini API или Google AI Studio, точных цен Google не назвала, ограничившись словами о «конкурентоспособной стоимости» и «экономичности». Бизнесу для доступа к Gemini Enterprise нужно попасть в список закрытого предпросмотра; часть направлений, Customer Experience и интеграция с Workspace, помечены как «скоро» и пока недоступны. Рядовому пользователю никаких действий предпринимать не нужно: функции появятся в Search Live, приложении Gemini Live, Google Docs, Gmail и Keep по мере открытия доступа.

Можно ли доверять

Все цифры в анонсе, это собственные замеры Google на сторонних бенчмарках (Artificial Analysis, Sierra, ServiceNow), но методология тестов в статье не раскрыта, а результат на EVA-Bench прямо помечен как измеренный только для одной конфигурации, Live API на платформе Gemini Enterprise Agent Platform. Ни один из четырёх приведённых результатов не измерен для базовой Gemini 3.8 Live, только для версии Extended Thinking. Сравнения с конкурентами по цене не подкреплены цифрами: формулировки вроде «конкурентоспособная цена» остаются качественными, без конкретных сумм. Источник, официальный блог Google, без независимых комментариев.

Риски и подводные камни

Google не назвала ни одной цены или тарифа ни для одной из моделей, оценить реальную стоимость использования по анонсу невозможно. Доступ для бизнеса пока ограничен закрытым предпросмотром, а часть функций (для Customer Experience и бизнес-клиентов Workspace) ещё не запущена. Водяной знак SynthID, по собственной формулировке Google, лишь «помогает» выявлять сгенерированный звук и не исключает дезинформацию полностью, это не гарантия, а один из инструментов защиты. Наконец, все заявленные успехи в бенчмарках, самоотчёт компании, без независимой проверки третьей стороной.