漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

谷歌 DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,官方称其为迄今最具表现力的音频模型。新模型允许开发者通过文字描述来创建声音,并可对语速、方言、情绪和逐句表达方式进行精细控制。其中 Flash-Lite 面向配音、语音代理等高吞吐量场景进行优化,兼顾效率和成本;Flash 则可在授权前提下,仅用 30 秒语音样本复刻特定音色。这一进展推动语音合成从简单朗读走向可设计、可导演的生成时代,也降低了短剧、有声内容、智能助手等领域高质量语音生产的门槛。

核心要点

  • Gemini 3.8 Flash TTS 与 Flash-Lite TTS 可根据描述生成声音并精细控制节奏、方言和演绎方式
  • Flash-Lite 面向配音和语音代理等高并发任务,Flash 可从 30 秒授权样本复刻声音
  • 新模型标志语音合成从文本朗读向可设计、可导演的生成范式演进

Read more >