谷歌週三推出兩款新的文本轉語音模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,進一步擴充套件 Gemini 在 AI 語音生成領域的佈局。兩款模型定位不同:Flash TTS 更強調聲音表現力與複雜創意場景,Flash-Lite TTS 則針對大規模、低成本的語音生成做最佳化,覆蓋內容配音、音訊製作以及即時語音代理等用途。
從開發者文件披露的引數看,Gemini 3.8 Flash TTS 支援 130 種語言,Flash-Lite TTS 支援 101 種語言,兩者均可根據文字指令調整聲音、語速、情緒和對話方式。這意味著開發者不必再依賴固定的預設音色,而是可以用自然語言去描述想要的聲音效果。
Flash TTS 的核心賣點是聲音定製。谷歌介紹,該模型主要面向有聲書、播客、遊戲角色和互動媒體等創意應用,使用者可以通過自然語言提示詞從零設計聲音,包括角色設定、口音和聲音特徵。模型還支援根據約 30 秒的音訊樣本複製聲音。在聲音複製環節,谷歌表示需要獲得聲音所有者的同意,並通過相應的同意驗證機制;生成的音訊會嵌入不可感知的 SynthID 水印,以便識別 AI 生成的語音內容。
在第三方評測方面,Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 中取得 71.4 分,在聲音設計綜合指標中排名第一;兩款模型在 Hume AI Overall Quality Index 中分別位列第一和第二。谷歌目前提供超過 2000 種可直接使用的聲音,並覆蓋墨西哥西班牙語、魁北克法語和蘇格蘭英語等地區性語言變體。
多角色對話是兩款模型共同的另一項強化。它們支援對每一句台詞進行單獨控制,使用者可以通過指令碼指令調整語氣、節奏、情緒以及停頓。谷歌稱,新模型支援雙人對話,並能在同一指令碼中保持不同角色的聲音區分;模型還可以生成笑聲、嘆氣等非語言聲音,以及“嗯”“是的”等對話中的回應,讓生成語音更接近真實交流。
接入方式上,兩款模型均已開始通過 Gemini API 和 Google AI Studio 向開發者提供。其中 Flash TTS 還可用於 Gemini Notebook,Flash-Lite TTS 已接入 Google Vids;面向企業的 Gemini Enterprise API 支援將於後續推出。
從產品定位看,谷歌此次更新並非單純提升文本轉語音的自然度,而是試圖增強使用者對 AI 聲音“設計”和“表演”的控制能力,使語音生成從固定音色選擇向可定製的角色、場景和多角色對話擴充套件。這一方向與當前大模型廠商在多模態互動上的競爭主線一致:語音正從附屬功能變成獨立的創作與代理介面。對內容製作方而言,低成本、多語言的語音生成有望壓縮配音與音訊製作的開支;對即時語音代理開發者而言,Flash-Lite 的定位則指向更高併發、更低單次呼叫成本的場景。與此同時,聲音複製能力帶來的授權與合規問題,以及 SynthID 這類水印機制能否被廣泛接受,仍是這類產品落地時需要持續觀察的變數。