Aivora
Google DeepMind語音 AI進階

Google 發表 Gemini 3.8 TTS:從語音合成邁向客製化「聲音工作室」的革命性升級

Google Introduces Gemini 3.8 TTS: Transforming Text-to-Speech into a Creative Voice Studio

2 分鐘閱讀
Google 發表 Gemini 3.8 TTS:從語音合成邁向客製化「聲音工作室」的革命性升級
30 秒看懂

Google DeepMind 發表兩款全新語音合成模型:Gemini 3.8 Flash TTS(專攻創意角色設計與精準執導)與 Gemini 3.8 Flash-Lite TTS(專攻低成本、大規模的配音與客服 Agent)。使用者只需輸入自然語言描述,即可生成超過 100 種語言與方言的客製化嗓音,或提供 30 秒樣本複製聲音。此外,模型支援雙人劇本對話與笑聲、嘆氣等語氣點綴,在 Hume AI 基準測試中榮登第一。

核心重點

01

自然語言語音設計

不需依賴固定預設,使用者可直接用文字指令描述角色的口音、個性與特徵,生成橫跨 100 多種語言的獨特聲音。

02

劇本級逐行導演控制

允許加入舞台動作指引,並能在對話中動態穿插非言語反應(如笑聲 <laughs>、嘆氣 <sigh> 或搭腔),且支援雙人對手戲編排。

03

30 秒安全聲音複製

僅需提供 30 秒授權音檔即可複製聲音,並結合即時口頭同意驗證、SynthID 隱形浮水印與 C2PA 憑證防範深偽濫用。

04

橫掃語音基準測試

在 Hume AI 的語音設計基準與整體品質指數上雙雙包辦前兩名,並在 Voice Arena 多國語系盲測中奪下領先地位。

技術圖解

Gemini 3.8 TTS 模型版本對照
Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS
設計核心深度創意控制、角色塑造與情境執導高吞吐量、低成本的大規模應用
典型應用遊戲配音、有聲書、多人口白 Podcast影片自動翻譯配音、對話式客服 Agent
Hume AI 品質排名第 1 名 (兼具極致語音設計表現)第 2 名 (高效率下仍維持優秀音質)
預載產品Gemini NotebookGoogle Vids

為什麼重要

此技術將文字轉語音(TTS)從單調的「預設語音播放」轉型為「全數位化錄音室」。創作者與開發者能以極低門檻為遊戲、有聲書或客服 Agent 設計充滿情感且具地方口音的數位聲音。此外,結合 SynthID 浮水印與強制口頭同意機制的安全設計,為 AI 生成語音時代的智財保護與防偽樹立了新標竿。

對誰有影響

  • AI 開發者
  • 內容創作者
  • 企業決策者
  • 產品經理

可以怎麼使用

  1. 1遊戲與有聲書精緻角色配音
  2. 2雙人對談 Podcast 與劇本朗讀
  3. 3具備情緒感染力的大規模語音客服與在地化翻譯配音

限制與注意事項

  • 「聲音混音調整」(Voice Remixing)微調特徵的功能目前仍為即將推出,尚未全面開放。
  • 嚴格的口頭同意驗證雖能保障安全,但也可能增加自動化或批次語音複製的工作流程複雜度。

延伸閱讀

聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」
arXiv語音 AI

聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」

Hearing the Truth: VeriSpeak Exposes the Text-Speech Modality Gap in Fact-Checking

本研究推出首個語音事實查核基準測試 VeriSpeak,揭示大型語音語言模型(LALM)在處理語音陳述時存在「文本-語音模態差距」,並證實結合檢索與顯式推理(如思考微調)能顯著提升查核準確度至 86.1%。

2 分鐘閱讀