谷歌发布 Gemini 3.8 Flash TTS 系列:可描述生成声音并逐句导演表达
talkingdev • 2026-09-24
2043 views
谷歌 DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,官方称其为迄今最具表现力的音频模型。新模型允许开发者通过文字描述来创建声音,并可对语速、方言、情绪和逐句表达方式进行精细控制。其中 Flash-Lite 面向配音、语音代理等高吞吐量场景进行优化,兼顾效率和成本;Flash 则可在授权前提下,仅用 30 秒语音样本复刻特定音色。这一进展推动语音合成从简单朗读走向可设计、可导演的生成时代,也降低了短剧、有声内容、智能助手等领域高质量语音生产的门槛。
核心要点
- Gemini 3.8 Flash TTS 与 Flash-Lite TTS 可根据描述生成声音并精细控制节奏、方言和演绎方式
- Flash-Lite 面向配音和语音代理等高并发任务,Flash 可从 30 秒授权样本复刻声音
- 新模型标志语音合成从文本朗读向可设计、可导演的生成范式演进