Google 發表 Gemini 3.8 TTS:從語音合成邁向客製化「聲音工作室」的革命性升級
Google Introduces Gemini 3.8 TTS: Transforming Text-to-Speech into a Creative Voice Studio

Google DeepMind 發表兩款全新語音合成模型:Gemini 3.8 Flash TTS(專攻創意角色設計與精準執導)與 Gemini 3.8 Flash-Lite TTS(專攻低成本、大規模的配音與客服 Agent)。使用者只需輸入自然語言描述,即可生成超過 100 種語言與方言的客製化嗓音,或提供 30 秒樣本複製聲音。此外,模型支援雙人劇本對話與笑聲、嘆氣等語氣點綴,在 Hume AI 基準測試中榮登第一。
核心重點
自然語言語音設計
不需依賴固定預設,使用者可直接用文字指令描述角色的口音、個性與特徵,生成橫跨 100 多種語言的獨特聲音。
劇本級逐行導演控制
允許加入舞台動作指引,並能在對話中動態穿插非言語反應(如笑聲 <laughs>、嘆氣 <sigh> 或搭腔),且支援雙人對手戲編排。
30 秒安全聲音複製
僅需提供 30 秒授權音檔即可複製聲音,並結合即時口頭同意驗證、SynthID 隱形浮水印與 C2PA 憑證防範深偽濫用。
橫掃語音基準測試
在 Hume AI 的語音設計基準與整體品質指數上雙雙包辦前兩名,並在 Voice Arena 多國語系盲測中奪下領先地位。
技術圖解
| Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS | |
|---|---|---|
| 設計核心 | 深度創意控制、角色塑造與情境執導 | 高吞吐量、低成本的大規模應用 |
| 典型應用 | 遊戲配音、有聲書、多人口白 Podcast | 影片自動翻譯配音、對話式客服 Agent |
| Hume AI 品質排名 | 第 1 名 (兼具極致語音設計表現) | 第 2 名 (高效率下仍維持優秀音質) |
| 預載產品 | Gemini Notebook | Google Vids |
為什麼重要
此技術將文字轉語音(TTS)從單調的「預設語音播放」轉型為「全數位化錄音室」。創作者與開發者能以極低門檻為遊戲、有聲書或客服 Agent 設計充滿情感且具地方口音的數位聲音。此外,結合 SynthID 浮水印與強制口頭同意機制的安全設計,為 AI 生成語音時代的智財保護與防偽樹立了新標竿。
對誰有影響
- AI 開發者
- 內容創作者
- 企業決策者
- 產品經理
可以怎麼使用
- 1遊戲與有聲書精緻角色配音
- 2雙人對談 Podcast 與劇本朗讀
- 3具備情緒感染力的大規模語音客服與在地化翻譯配音
限制與注意事項
- 「聲音混音調整」(Voice Remixing)微調特徵的功能目前仍為即將推出,尚未全面開放。
- 嚴格的口頭同意驗證雖能保障安全,但也可能增加自動化或批次語音複製的工作流程複雜度。
延伸閱讀
聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」
Hearing the Truth: VeriSpeak Exposes the Text-Speech Modality Gap in Fact-Checking
本研究推出首個語音事實查核基準測試 VeriSpeak,揭示大型語音語言模型(LALM)在處理語音陳述時存在「文本-語音模態差距」,並證實結合檢索與顯式推理(如思考微調)能顯著提升查核準確度至 86.1%。