Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS: голоса по текстовому описанию

Google представила две новые модели синтеза речи (text-to-speech, TTS) в семействе Gemini: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. В компании говорят, что они превращают генерацию голоса из набора статичных пресетов в «динамическую творческую студию». Модели дополняют аудиосемейство Gemini, в которое уже входят 3.5 Live Translate, 3.5 Transcribe, 3.8 Live и 3.8 Live Extended Thinking.\n\nGemini 3.8 Flash TTS рассчитана на творческую режиссуру и проработку персонажей: новые голоса создаются с нуля по описанию на естественном языке (игры, аудиокниги, подкасты, интерактивные медиа), а подачей каждой реплики можно управлять через актёрские подсказки, темп, смену диалекта и «бэкченнелинг» (короткие реплики слушателя вроде «угу»). Gemini 3.8 Flash-Lite TTS рассчитана на большие объёмы и экономичность: массовый дубляж, создание аудиоконтента, выразительные голосовые агенты с тонкой настройкой тона, темпа и оттенков.\n\nВозможности работы с голосами. Генеративный дизайн голоса в Flash TTS позволяет задавать роль, акцент и характеристики более чем для 100 языков и диалектов. Библиотека включает более 2000 готовых к использованию голосов, в том числе региональные варианты вроде мексиканского испанского, квебекского французского и шотландского английского. Репликация голоса, по 30-секундному образцу собственного голоса или голоса, на который есть права; она подкреплена проверкой согласия, водяными знаками SynthID и учётными данными C2PA. Созданные голоса можно сохранять и переиспользовать, чтобы они не «плыли» между проектами. «Ремикс» голоса (тонкая настройка тембра, высоты, темпа и акцента по текстовым подсказкам) помечен как «скоро».\n\nУправление исполнением. Обе модели позволяют режиссировать подачу построчно: сценические ремарки можно писать самому или доверить Gemini. По заявлению Google, длинные записи на протяжении нескольких часов сохраняют качество и тембр с минимальным «дрейфом» говорящего. Есть нативная постановка сцен с двумя участниками по единому сценарию с естественной сменой реплик, а также вставки вроде
Ключевые факты
- Две новые модели: Gemini 3.8 Flash TTS (создание голосов с нуля по текстовому описанию, режиссура реплик) и Gemini 3.8 Flash-Lite TTS (массовый дубляж, аудиоконтент, голосовые агенты).
- Библиотека, более 2000 готовых голосов; репликация голоса по 30-секундному образцу с проверкой согласия, SynthID и C2PA; генеративный дизайн голоса для 100+ языков и диалектов.
- По данным Google, Flash TTS, №1 в Voice Design Benchmark от Hume AI (71,4) и в моделировании акцентов (60,8); Flash TTS и Flash-Lite TTS, №1 и №2 в Overall Quality Index Hume AI.
- Доступно разработчикам в Gemini API и Google AI Studio; для всех, в Gemini Notebook (Flash) и Google Vids (Flash-Lite); для корпоративных клиентов через Gemini Enterprise, «скоро».
- Ремикс голосов пока не доступен (помечен «скоро»); цены в анонсе не указаны.
Почему это важно
Google переводит синтез речи от набора готовых голосов к созданию новых голосов по текстовому описанию, с построчной режиссурой и постановкой диалога двух говорящих. Это развитие аудиосемейства Gemini, где уже есть модели перевода в реальном времени, транскрибации и живого диалога. Модель предыдущего поколения в источнике названа Gemini 3.1 Flash TTS; количественного сравнения с ней не приведено.
Кому это важно
Разработчикам голосовых агентов и приложений, создателям подкастов, аудиокниг и игровых персонажей, командам, занимающимся дубляжом и локализацией медиа. Партнёрами названы Figma, HeyGen, Linguana, Wondercraft, 99.co и Ollang, платформами на базе Gemini API, Agora, LiveKit, Pipecat и Vercel.
Как это применить
Разработчики могут попробовать модели в Google AI Studio (аудиопощадка с дизайном голоса, репликацией и редактором сценария на двух говорящих) и через Gemini API. Flash TTS подходит для творческих задач с персонажами, Flash-Lite TTS, для больших объёмов дубляжа и голосовых агентов. Обычным пользователям модели доступны в Gemini Notebook (Flash) и Google Vids (Flash-Lite). Для корпоративных клиентов API в Gemini Enterprise ещё не открыт («скоро»). Цены в анонсе не указаны.
Можно ли доверять
Это анонс самой Google, написанный от первого лица. Оценки Hume AI и Voice Arena приведены без шкал и результатов конкурентов, сравнение с Gemini 3.1 Flash TTS, без цифр, независимая проверка в тексте не упоминается. Относитесь к рейтингам как к заявлениям производителя, пока нет собственных тестов на ваших языках и задачах.
Риски и подводные камни
Технология репликации голоса по 30-секундному образцу несёт риск злоупотреблений; Google заявляет о проверке согласия (устная запись владельца голоса, совпадающая с референсным говорящим), водяных знаках SynthID на каждом клипе и учётных данных C2PA. Часть возможностей пока недоступна: ремикс голосов и доступ через Gemini Enterprise помечены «скоро», сроков нет. Заявление о минимальном дрейфе голоса на протяжении часов записи, утверждение Google без количественных подтверждений.