Кратко
Google выпустила новую модель синтеза речи Gemini 3.1 Flash TTS, которая предлагает студийное качество озвучки с высокой выразительностью. Модель поддерживает 70 языков и позволяет управлять интонациями и эмоциями с помощью специальных тегов в тексте, что значительно упрощает создание и локализацию аудиоконтента.
- Качество аудио сопоставимо со студийной записью, но генерируется за секунды.
- Поддерживает 70 языков, включая русский, для глобального охвата аудитории.
- Теги управления голосом (например, [cough], [laugh], [pause]) позволяют режиссировать озвучку прямо в тексте.
- Модель доступна бесплатно в режиме предварительного просмотра через AI Studio от Google.
- Обеспечивает естественные интонации и эмоции, делая голос «живым», а не роботизированным.