Aivora
arXiv語音 AI進階

免訓練提升語音情緒!EmoRES-TTS 透過「殘差向量分解」實現精準可控的語音合成

EmoRES-TTS: Training-Free Residual-Enhanced Vector Steering for Emotional Speech Generation

2 分鐘閱讀
免訓練提升語音情緒!EmoRES-TTS 透過「殘差向量分解」實現精準可控的語音合成
30 秒看懂

傳統語音合成(TTS)模型若要調整情緒,通常需要耗費高昂成本進行模型微調。現有的「向量引導」(如 CoCoEmo)雖然免訓練,但因將情緒向量視為單一整體控制,效果受限。本研究發現情緒向量可拆分為「偏離中性」與「特定情緒」兩個部分,並推出 EmoRES 方法。在 IndexTTS-2 與 CosyVoice2 骨幹模型上,EmoRES 無需任何重新訓練,即在情緒精準度與人類偏好的自然度上顯著超越前人研究。

核心重點

01

情緒向量的二分發現

研究發現情緒引導向量可分解為「擺脫中性表達」的共享成分與「指向特定目標情緒」的殘差成分。

02

完全免訓練的即插即用

EmoRES 直接修改凍結骨幹模型(如 CosyVoice2)的內部表示法,完全無需繁瑣的重訓過程或情緒標註資料。

03

客觀情緒指標顯著躍升

在 IEMOCAP 資料集測試中,EmoRES 使等級相關性大幅提升(最高相對增加 118.8%),情緒命中率最高相對提升 20.1%。

04

更自然的人類聆聽體驗

人類評測顯示,EmoRES 在高達 63.8% 的成對比較中被判定擁有更好的語音自然度,且情緒辨識度提升達 35%。

技術圖解

EmoRES 向量分解引導流程
目標文字與情緒情緒向量EmoRES 分解共享成分 (遠離中性)殘差成分 (特定情緒)融合引導凍結的骨幹模型高自然度情緒語音

為什麼重要

這項研究解決了語音合成(TTS)中「高品質情緒控制」與「高昂訓練成本」之間的拉鋸。傳統上,要讓 AI 說出充滿情感的語音,需要昂貴的標註資料與重新訓練。EmoRES 證明了僅需透過免訓練的內部向量微調,就能更細緻地拆分並強化特定情感,不僅大幅降低開發門檻,更相容於 IndexTTS-2 及 CosyVoice2 等主流骨幹模型,為即時、可控的擬真語音助理與虛擬人奠定技術基礎。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1即時互動語音助理:在不重訓模型的前提下,動態調整助理的語氣與情緒起伏。
  2. 2虛擬主播與有聲書配音:精準微調特定語句的「戲劇張力」與特定情感表現。
  3. 3情緒語音訓練資料生成:以低成本生成帶有不同情緒強度的合成語音,用於其他語音模型的訓練。

限制與注意事項

  • 仍受限於骨幹模型本身的基礎表徵能力,若骨幹模型原本就無法表達某種音調特徵,向量引導的效果也會受限。
  • 雖然不需訓練,但在推論時仍需要準確估算和設定共享成分與殘差成分的調節權重。

延伸閱讀

聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」
arXiv語音 AI

聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」

Hearing the Truth: VeriSpeak Exposes the Text-Speech Modality Gap in Fact-Checking

本研究推出首個語音事實查核基準測試 VeriSpeak,揭示大型語音語言模型(LALM)在處理語音陳述時存在「文本-語音模態差距」,並證實結合檢索與顯式推理(如思考微調)能顯著提升查核準確度至 86.1%。

2 分鐘閱讀