Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Google выпустила модели Gemini 3.8 Flash TTS для создания голосов по текстовому описанию

Google представила модели синтеза речи Gemini 3.8 Flash TTS и Flash-Lite TTS с поддержкой более 100 языков и диалектов. Старшая модель позволяет проектировать голоса с помощью текстовых запросов и воспроизводить голос по 30-секундному образцу.

Google представила две модели синтеза речи: Gemini 3.8 Flash TTS для творческих задач и Gemini 3.8 Flash-Lite TTS для массовой и более экономичной генерации аудио. Обе поддерживают более 100 языков и диалектов.

Gemini 3.8 Flash TTS позволяет создавать голос с нуля, задавая текстом его роль, акцент и другие характеристики. Также доступна библиотека из более чем 2000 готовых голосов и функция воспроизведения голоса по 30-секундной записи. Для последней требуется отдельная запись согласия владельца голоса; созданное аудио маркируется водяным знаком SynthID и метаданными C2PA.

Модели поддерживают построчное управление интонацией, темпом и эмоциями, генерацию продолжительного аудио и диалогов двух персонажей из одного сценария. Они начали появляться в Gemini API и Google AI Studio; корпоративный доступ через Gemini Enterprise API будет открыт позднее. Функция воспроизведения голоса недоступна в Европейской экономической зоне, Великобритании, Швейцарии, Индии, а также в американских штатах Иллинойс и Техас.

Источник: blog.google

Связь с редакцией