Google представила Gemini 3.5 Transcribe, модель распознавания речи для разработчиков

Google представила Gemini 3.5 Transcribe, модель распознавания речи для разработчиков

Google DeepMind представила Gemini 3.5 Transcribe, модель преобразования речи в текст, которую компания называет своей самой точной моделью распознавания речи на сегодняшний день. В отличие от обычных систем распознавания, которые плохо справляются с фоновым шумом, сложной терминологией и «мусором» в речи (паузы, самокоррекции), Gemini 3.5 Transcribe сразу превращает аудио в чистый, отформатированный текст.

Модель доступна через два отдельных API. Live API (модель gemini-3.5-transcribe-live) обеспечивает непрерывную двустороннюю потоковую передачу с задержкой менее секунды, для интерактивных голосовых приложений. Interactions API (модель gemini-3.5-transcribe) расшифровывает уже записанное аудио, встречи, звонки и подобное, с разбивкой по спикерам и таймстампами на уровне слов.

Среди возможностей: умная обработка речи (модель распознаёт самокоррекции вроде «встретимся во вторник, нет, в среду», убирает слова-паразиты и сама форматирует текст), вызов функций (модель может передавать сложные задачи, например генерацию изображений или анализ файлов, другим моделям Gemini, пока доступно только в приложении Gemini для macOS), поддержка пользовательского словаря для узкоспециальной терминологии, автоматическое определение и расшифровка более 85 языков с учётом региональных акцентов, а также определение до трёх спикеров в записанном аудио с таймстампами (поддержка более трёх спикеров пока экспериментальная).

По данным независимой площадки для замеров Artificial Analysis, на которые ссылается Google, средняя доля ошибок в словах (WER) у новой модели составляет 4,0% для потокового режима и 2,6% для режима записи; время получения финальной расшифровки сократилось на 70% по сравнению с предыдущей моделью компании, Chirp 3. На бенчмарке FLEURS (набор ведущих языков и локалей) модель показывает WER 5,50% в потоковом режиме и 5,04% в режиме записи, что также лучше показателей Chirp 3.

Для разработчиков модель доступна в публичном превью через Gemini API в Google AI Studio (в том числе в режиме Build, для голосового «вайб-кодинга» приложений) и в Google Antigravity, где модель сопоставляет контекст экрана и историю чата (с разрешения пользователя) для точной расшифровки имён файлов и рабочих документов. Для бизнеса модель доступна через Gemini Enterprise Agent Platform, в перспективе, и в Gemini Enterprise for Customer Experience. Конечные пользователи уже получили доступ к модели: в приложении Gemini на macOS (на английском языке) она не только расшифровывает свободную речь, но и выполняет голосовые команды с учётом контекста экрана, например, суммирует локальные файлы или создаёт изображения; на Android, через новую функцию Rambler в Gboard (в отдельных странах и языках), позволяющую превращать устную речь в оформленный текст и вносить правки голосом. Поддержка в браузере Chrome заявлена как «скоро».

Google также ссылается на платформы для разработчиков, Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, которые используют Gemini Live API, чтобы строить голосовые интерфейсы поверх готовой инфраструктуры потоковой передачи медиа. О положительном опыте использования модели, по словам Google, также сообщили компании Vivo, Intellitek Health и Lingopal, отметившие низкую задержку, точность и широкую языковую поддержку, детали их отзывов источник не приводит.

Ключевые факты

  • Google DeepMind выпустила Gemini 3.5 Transcribe, модель распознавания речи, доступную через Live API (потоковый режим) и Interactions API (запись, с разбивкой по спикерам и таймстампами)
  • По данным Artificial Analysis, средний WER составляет 4,0% для потокового режима и 2,6% для режима записи; время до финальной расшифровки сократилось на 70% по сравнению с предыдущей моделью компании Chirp 3
  • На бенчмарке FLEURS показатели WER, 5,50% (потоковый режим) и 5,04% (режим записи)
  • Модель автоматически распознаёт более 85 языков и определяет до трёх спикеров в записанном аудио (поддержка большего числа, экспериментальная)
  • Модель уже работает в функции Rambler на Android, в приложении Gemini на macOS и в Google AI Studio; разработчикам доступна в публичном превью, поддержка Chrome обещана «скоро»

Почему это важно

Google обновила модель распознавания речи и, по собственным данным, заметно продвинулась вперёд по сравнению с предыдущим поколением: точность выросла, а время до готовой расшифровки сократилось на 70% (по данным Artificial Analysis). Для голосовых интерфейсов, от диктовки до колл-центров, это означает меньше задержек и меньше ошибок в шумной реальной обстановке, включая распознавание буквенно-цифровых данных вроде почтовых индексов и номеров заказов.

Кому это важно

Разработчикам голосовых агентов, инструментов субтитрирования в реальном времени и систем аналитики звонков, которые получают модель через Gemini API. Компаниям, использующим Gemini Enterprise Agent Platform (и в перспективе, Gemini Enterprise for Customer Experience). Обычным пользователям продуктов Google, тем, кто пользуется функцией Rambler на Android, приложением Gemini на macOS или голосовым вводом в Google AI Studio.

Как это применить

Разработчики подключают модель через Gemini API в Google AI Studio (публичное превью), потоковую версию gemini-3.5-transcribe-live через Live API для интерактивных приложений или gemini-3.5-transcribe через Interactions API для расшифровки уже записанного аудио с атрибуцией по спикерам. Готовую инфраструктуру потоковой передачи поверх Live API предоставляют партнёрские платформы, Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Для бизнес-сценариев модель доступна через Gemini Enterprise Agent Platform. Стоимость использования источник не называет.

Можно ли доверять

Все цифры в материале, из собственного блога Google DeepMind, а показатели WER и время расшифровки измерены сторонней площадкой Artificial Analysis, но независимого повторения замеров источник не приводит. Сравнение дано только с предыдущей моделью самой Google (Chirp 3), сопоставления с моделями распознавания речи других компаний в материале нет. Автор поста и точная дата публикации не указаны, отзывы партнёрских компаний приведены без деталей.

Риски и подводные камни

Метрики точности и скорости, самоотчёт компании, без независимой верификации в источнике. Ряд функций (в частности, работа с контекстом экрана в Google Antigravity) требует разрешения пользователя на доступ к содержимому экрана и истории чата, что стоит учитывать с точки зрения приватности. Часть возможностей, вроде поддержки Chrome, пока не запущена, конкретной даты релиза источник не даёт. Определение более трёх спикеров одновременно остаётся экспериментальным.