Google представила Gemini 3.8 Flash TTS для генерации и клонирования голосов

Google представила две новые модели преобразования текста в речь в семействе Gemini: Gemini 3.8 Flash TTS, рассчитанную на глубокую творческую режиссуру и создание персонажей, и Gemini 3.8 Flash-Lite TTS, оптимизированную для дешёвого и массового озвучивания. Модели дополняют аудиосемейство Gemini, в которое уже входят 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking. Главная новинка, генеративный дизайн голоса: вместо 30 исходных пресетов пользователь может текстовым промптом на более чем 100 языках и диалектах создать полностью новый голос с нужной ролью, акцентом и характером, от огнедышащего дракона до рассказчика с выраженным региональным говором. Помимо этого доступна библиотека из более чем 2000 готовых голосов с широким языковым покрытием, включая мексиканский испанский, квебекский французский и шотландский английский. Появилась и репликация голоса: систему можно обучить по 30-секундному аудиообразцу, при этом для создания голоса требуется верифицированная голосовая запись согласия от владельца голоса, а каждый сгенерированный аудиофайл помечается водяным знаком SynthID и снабжается метаданными C2PA. Заявлена и функция ремикса голосов, тонкая настройка тембра, высоты, темпа и акцента у готового голоса из библиотеки, но она пока в разработке и появится позже. Обе модели дают построчный контроль над исполнением: авторские сценарные указания, естественные звуковые реакции вроде смеха или вздоха, стабильное качество голоса на протяжении долгих записей (подкасты, аудиокниги) и раздельную постановку сцен с двумя говорящими в одном сценарии. По внутренним тестам Google, Gemini 3.8 Flash TTS заняла первое место в общем зачёте бенчмарка дизайна голосов Hume AI Voice Design Benchmark с результатом 71,4 балла и лидирует в моделировании акцентов с результатом 60,8 балла; обе новые модели также заняли первое и второе места в индексе общего качества Hume AI Overall Quality Index. В слепых оценках предпочтений пользователей на платформе Voice Arena модели заняли верхние позиции среди конкурентов в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди, всего заявлена поддержка более 100 языков. Для разработчиков модели доступны через Gemini API и Google AI Studio, где появилась новая песочница для дизайна голоса и построчной режиссуры; для конечных пользователей Flash TTS встраивается в Gemini Notebook, а Flash-Lite TTS, в Google Vids. Доступ через API в корпоративном продукте Gemini Enterprise для бизнеса пока не запущен и появится позже. Развёртывать голосовые интерфейсы на основе Gemini API помогают платформы Agora, LiveKit, Pipecat и Vercel, а среди компаний, уже интегрирующих новые модели TTS, Google называет Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang, для дубляжа контента, локализации с региональными акцентами и голосовых агентов.
Ключевые факты
- Google выпустила Gemini 3.8 Flash TTS (для творческой режиссуры голосов) и Gemini 3.8 Flash-Lite TTS (для массового дешёвого озвучивания)
- Библиотека выросла с 30 исходных голосов до 2000+ готовых, плюс генеративный дизайн новых голосов текстовым промптом на более чем 100 языках
- Репликация голоса по 30-секундному образцу требует верифицированной записи согласия владельца, каждый клип маркируется водяным знаком SynthID
- На бенчмарке Hume AI Voice Design Benchmark Flash TTS набрала 71,4 балла в общем зачёте и 60,8 в моделировании акцентов, заняв первые места
- Модели доступны через Gemini API и Google AI Studio, а также в Gemini Notebook и Google Vids; доступ в Gemini Enterprise пока не запущен
Почему это важно
Google переводит синтез речи от фиксированного набора голосов к творческому инструменту: голос теперь можно спроектировать текстовым промптом или воссоздать по короткому образцу, а не выбирать из ограниченного списка пресетов. Это заметный шаг в гонке TTS-моделей, где Google заявляет лидерство по внешним бенчмаркам Hume AI.
Кому это важно
Разработчикам голосовых агентов и приложений, студиям озвучивания игр, подкастов и аудиокниг, компаниям, занимающимся дубляжом и локализацией контента, а также продуктовым командам, которые уже используют Gemini Notebook или Google Vids.
Как это применить
Доступ к моделям открыт через Gemini API и Google AI Studio, где появилась песочница для дизайна голоса и построчной режиссуры сценариев с двумя говорящими; репликацию голоса тоже можно опробовать в AI Studio. Для конечных пользователей Flash TTS встроена в Gemini Notebook, а Flash-Lite TTS, в Google Vids. Доступ через API для корпоративного Gemini Enterprise и функция ремикса готовых голосов заявлены как «скоро», цены в источнике не названы.
Можно ли доверять
Материал, официальный анонс Google в блоге компании, без указания конкретного автора или спикера; цифры и бенчмарки приведены как собственные измерения Google без независимой проверки, поэтому заявления о лидерстве стоит воспринимать как самооценку производителя.
Риски и подводные камни
Технология клонирования голоса по короткому образцу повышает риск подделок и мошенничества с голосом; Google заявляет о защитных мерах, верификации согласия владельца голоса и водяных знаках SynthID с метаданными C2PA, но независимо оценить их надёжность на данный момент нельзя.
«Каждый аудиоклип, сгенерированный нашими моделями Gemini Audio, помечается водяным знаком SynthID.»
— Google, блог компании