Gemini 3.8 TTS может создавать голоса по текстовым описаниям и клонировать их
- Google запустила модели Gemini 3.8 Flash TTS и Flash-Lite TTS для генерации речи по текстовому описанию более чем на 100 языках.
- Модель Flash TTS способна клонировать голос по 30-секундной аудиозаписи с подтвержденным согласием владельца и предлагает свыше 2000 готовых вариантов.
- Новинки заняли верхние строчки в бенчмарках Hume AI и внедряются партнерами, включая Figma, HeyGen, Google Vids и Gemini Notebook.

«Сегодня мы представляем две новые модели синтеза речи в семействе Gemini, превращая генерацию голоса из статических пресетов в динамичную творческую студию», — написала компания Google в своем анонсе.
В среду Google выпустила модели Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Обе они начинают развертываться с сегодняшнего дня в Gemini API и Google AI Studio. Они пополняют семейство Gemini 3.8, которое Google запустила ранее в этом месяце.
Модель Flash TTS создана для творческих задач, таких как видеоигры, аудиокниги и подкасты. Flash-Lite TTS — это более дешевый вариант с поддержкой больших объемов данных, ориентированный на дубляж и голосовых агентов, сообщает Google.
Голоса, создаваемые по текстовому запросу
С помощью Flash TTS пользователи могут создавать новый голос с нуля, описывая его роль, акцент и характеристики простым языком более чем на 100 языках и диалектах. В качестве примеров Google приводит энергичного диджея из Мельбурна и японского дракона.
Пользователи также могут выбирать из библиотеки, насчитывающей более 2000 готовых голосов, включая региональные варианты, такие как мексиканский испанский, квебекский французский и шотландский английский. Пользовательские голоса можно сохранять для повторного использования в разных проектах. Скоро появится функция ремикширования голоса, позволяющая настраивать тембр, высоту тона, темп и акцент.
Обе модели позволяют пользователям управлять подачей материала построчно с помощью сценических ремарок. Они поддерживают сцены с участием двух дикторов в рамках одного сценария, а также длинные аудиозаписи продолжительностью в несколько часов. Сценарии могут включать такие реплики, как смех, вздохи и короткие междометия вроде «мгм».
Клонирование голоса по 30-секундному фрагменту
Flash TTS также может воссоздать голос по 30-секундному аудиофрагменту. По заявлению Google, пользователи должны предоставить запись устного согласия от владельца голоса, а система проверяет ее на соответствие эталонному спикеру перед созданием голоса.
Каждый клип, сгенерированный аудиомоделями Gemini от Google, содержит цифровой водяной знак SynthID, сообщает компания. Воссозданные голоса также снабжены учетными данными содержимого C2PA.
Бенчмарки и партнеры
Google заявляет, что Flash TTS заняла первое место в бенчмарке голосового дизайна Hume AI (Voice Design Benchmark) с результатом 71,4 балла. Компания отмечает, что Flash TTS и Flash-Lite TTS также заняли первое и второе места в индексе общего качества Hume AI (Overall Quality Index). По данным Google, в слепых тестах на предпочтения на Voice Arena модели заняли лидирующие позиции в таких языках, как японский, хинди и мексиканский испанский.
На рынке уже представлены такие специализированные компании, как ElevenLabs и индийская Murf AI, а в августе компания Adobe добавила генерацию речи в Firefly. Google назвала Figma, HeyGen, Wondercraft, Linguana, 99.co и Ollang в числе компаний, интегрирующих новые модели.
Flash TTS также появится в Gemini Notebook, а Flash-Lite TTS — в Google Vids. Скоро появится доступ для корпоративных клиентов через Gemini Enterprise.
