谷歌周三推出两款新的文本转语音模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,进一步扩展 Gemini 在 AI 语音生成领域的布局。两款模型定位不同:Flash TTS 更强调声音表现力与复杂创意场景,Flash-Lite TTS 则针对大规模、低成本的语音生成做优化,覆盖内容配音、音频制作以及实时语音代理等用途。
从开发者文档披露的参数看,Gemini 3.8 Flash TTS 支持 130 种语言,Flash-Lite TTS 支持 101 种语言,两者均可根据文字指令调整声音、语速、情绪和对话方式。这意味着开发者不必再依赖固定的预设音色,而是可以用自然语言去描述想要的声音效果。
Flash TTS 的核心卖点是声音定制。谷歌介绍,该模型主要面向有声书、播客、游戏角色和互动媒体等创意应用,用户可以通过自然语言提示词从零设计声音,包括角色设定、口音和声音特征。模型还支持根据约 30 秒的音频样本复制声音。在声音复制环节,谷歌表示需要获得声音所有者的同意,并通过相应的同意验证机制;生成的音频会嵌入不可感知的 SynthID 水印,以便识别 AI 生成的语音内容。
在第三方评测方面,Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 中取得 71.4 分,在声音设计综合指标中排名第一;两款模型在 Hume AI Overall Quality Index 中分别位列第一和第二。谷歌目前提供超过 2000 种可直接使用的声音,并覆盖墨西哥西班牙语、魁北克法语和苏格兰英语等地区性语言变体。
多角色对话是两款模型共同的另一项强化。它们支持对每一句台词进行单独控制,用户可以通过脚本指令调整语气、节奏、情绪以及停顿。谷歌称,新模型支持双人对话,并能在同一脚本中保持不同角色的声音区分;模型还可以生成笑声、叹气等非语言声音,以及“嗯”“是的”等对话中的回应,让生成语音更接近真实交流。
接入方式上,两款模型均已开始通过 Gemini API 和 Google AI Studio 向开发者提供。其中 Flash TTS 还可用于 Gemini Notebook,Flash-Lite TTS 已接入 Google Vids;面向企业的 Gemini Enterprise API 支持将于后续推出。
从产品定位看,谷歌此次更新并非单纯提升文本转语音的自然度,而是试图增强用户对 AI 声音“设计”和“表演”的控制能力,使语音生成从固定音色选择向可定制的角色、场景和多角色对话扩展。这一方向与当前大模型厂商在多模态交互上的竞争主线一致:语音正从附属功能变成独立的创作与代理接口。对内容制作方而言,低成本、多语言的语音生成有望压缩配音与音频制作的开支;对实时语音代理开发者而言,Flash-Lite 的定位则指向更高并发、更低单次调用成本的场景。与此同时,声音复制能力带来的授权与合规问题,以及 SynthID 这类水印机制能否被广泛接受,仍是这类产品落地时需要持续观察的变量。