借助Gemini 3.8 Flash TTS,创作者不只能把文稿转换为语音,还可以描述角色的声音、试听不同版本,并指导台词如何演绎。Google AI Studio将这些控制功能整合进一个用于创建声音和多角色对话的实验区。其配套模型Gemini 3.8 Flash-Lite TTS也在一项公开语音质量榜单中名列前茅。

模型排名

在Hume AI的公开排行榜上,Gemini 3.8 Flash TTS以71.4分位居Voice Design榜首。这项任务要求模型根据自然语言描述创建声音。在综合语音质量榜上,Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS包揽前两名。这些排名可以作为起点,但创作者仍需结合具体项目的台词和氛围试听声音。

彩色语音波形排列成竖列,其中一列在深色网格背景上高出其他各列。

▲ 声音设计排行榜

该模型生成的演示样本涵盖多种表演方式:贴耳般的ASMR式低语、强有力的戏剧化演绎、低沉的电影预告片旁白,以及西班牙语和印地语语音。生成样例中还有声音复刻。这些表演说明,声音设计不只是挑选悦耳的音色。口音、语速、声音质感和情绪引导都会影响台词的呈现效果。

创建并试听自定义声音

Google AI Studio提供两条路径。Voice Design根据文字描述创建声音。Voice Replication使用录制的说话人音频,但能否使用取决于用户所在地区。对于新角色,Voice Design让创作者可以在写完整段对话之前,先明确声音的表现方式。

  1. 打开Google AI Studio实验区。在模型选择器中找到音频模型,选择Gemini 3.8 Flash TTS。
  2. 选择Voice Design。描述说话人的年龄、口音、音色、语速和情绪气质。一个示例设定是:一位50多岁、言辞犀利、富有戏剧张力且带有冷幽默的英国女性建筑评论家。
  3. 如果描述需要更多细节,可以使用Improve My Prompt。它会将简短的角色设定扩展为涵盖口音、节奏和声音质感等方面的指令。
  4. 生成声音。一次声音设计会产生三个试听版本;应分别聆听它们的语气和发音,而不是将其视为可以互换的结果。
  5. 将选中的声音分配给一个语音块,然后编写多角色交流的台词。

确定说话人后,脚本还可以加入表演指令。Google AI Studio提供Whisper、Friendly、Narration、Promote和Podcast等风格。[chuckle]、[laugh]、**[cough]和[cheer]**等方括号提示可以直接写进对话台词。借助这些提示,无需使用用于控制合成语音的标记格式SSML,也能要求模型加入声音表情。生成的对话除了台词,还可以包含情绪变化、呼吸声和笑声。

双手在笔记本电脑上打字,彩色声波从屏幕呈弧形延伸至附近的麦克风。

▲ 文字引导的声音表演

实验区还提供temperature设置,用于调整生成结果的变化程度,以及控制口语填充词和停顿的Filter Words开关。基本声音和脚本确定后,值得再测试这些控制项:某句台词可能适合更口语化的表达,另一句则可能适合更干净利落的旁白风格。

将声音用于实验区之外

Get Code选项卡会显示使用google-genai库以编程方式生成音频的Python代码,让开发者可以把试听过的对话接入应用工作流。谷歌还提供覆盖100多种语言的2000多款现成声音,因此并非一定要从零开始设计声音。

潜在用途包括员工培训视频、产品操作演示和多语言内容本地化。一个实用的初步测试是编写一段包含两位风格迥异的说话人的短脚本:先精确定义其中一个声音,比较它的三个试听版本,再加入一种风格和一条声音表情提示,观察演绎方式如何变化。这套流程的主要优势是在声音设计和对话两个阶段都能控制表演;接下来要靠试听判断,这些控制能否服务于想要制作的内容。