Google представила модели Gemini 3.8 для генерации речи: новые возможности создания голоса и управления диалогами
Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS — новые модели синтеза речи, позволяющие создавать уникальные голоса по текстовому описанию и управлять эмоциями.

Google представила две новые модели преобразования текста в речь (text-to-speech, TTS) в семействе Gemini: 3.8 Flash TTS и 3.8 Flash-Lite TTS. Эти инструменты призваны превратить генерацию голоса из выбора статичных шаблонов в динамичную творческую студию. Теперь разработчики и создатели контента могут не просто озвучивать текст, но и детально режиссировать аудио.
Долгое время синтез речи страдал от монотонности и отсутствия эмоциональной окраски. Предыдущие поколения моделей научились звучать естественно, но им не хватало гибкости в управлении интонациями, паузами и акцентами. Новые модели Google решают эту проблему, предоставляя инструменты для тонкой настройки каждого произнесенного слова.
Модель Gemini 3.8 Flash TTS создана для глубокой творческой работы и дизайна персонажей. Она позволяет генерировать совершенно новые голоса с нуля, используя запросы на естественном языке (natural language prompts). Пользователь может описать нужный голос, например, попросив создать интонации огнедышащего дракона или энергичного радиоведущего.
Вторая модель, Gemini 3.8 Flash-Lite TTS, оптимизирована для масштабных и экономически эффективных задач. Она предназначена для потокового дубляжа, массового создания аудиоконтента и работы голосовых агентов, где требуется высокая скорость при сохранении контроля над тоном и темпом.
Ключевой особенностью обновления стала возможность построчного управления исполнением. Пользователи могут прописывать сценарные ремарки или позволить модели самой расставлять акценты. Поддерживаются невербальные звуки: смех, вздохи и междометия, которые добавляют реалистичности диалогам. Кроме того, модели умеют генерировать сцены с двумя говорящими из одного сценария, сохраняя естественное чередование реплик.
Разработчики также добавили функцию клонирования голоса (voice replication). Для создания вокального профиля достаточно 30 секунд аудио. Однако система требует обязательного подтверждения согласия: пользователь должен предоставить запись, где владелец голоса дает разрешение на его использование.
Внедрение таких технологий поднимает вопросы безопасности. Чтобы предотвратить распространение дезинформации, каждый аудиоклип, сгенерированный моделями Gemini, помечается невидимым водяным знаком SynthID. Это позволяет безошибочно определять происхождение аудиофайла.
Новые модели уже доступны разработчикам в Google AI Studio и через программный интерфейс (API) Gemini. Вскоре они появятся в корпоративных продуктах и пользовательских приложениях вроде Google Vids. Индустрия аудиокниг, подкастов и видеоигр получает мощный инструмент, который может значительно снизить затраты на озвучку и локализацию контента.
TL;DR
Главное
Google превращает синтез речи в полноценную режиссерскую панель, давая пользователям контроль над каждой репликой, эмоцией и фоновыми звуками.
Ключевые факты
- /Выпущены две модели: Flash TTS для креатива и Flash-Lite TTS для массовой генерации.
- /Создание уникальных голосов возможно по простому текстовому описанию.
- /Клонирование голоса требует 30 секунд аудио и обязательного голосового согласия диктора.
- /Все сгенерированные файлы защищены невидимыми водяными знаками SynthID.
Инсайт
Главная инновация моделей заключается не в улучшении качества звука, а в возможности сценарного управления многоголосыми диалогами через единый текстовый интерфейс.



