Hugging Face 推出 Open TTS Leaderboard:多語音合成與聲音複製的開源評測基準
Hugging Face Launches Open TTS Leaderboard for Multilingual TTS and Voice Cloning
隨著 Hugging Face 平台上的語音合成(TTS)模型突破 8,000 個,傳統仰賴人工投票的評測因耗時長、成本高且對開源模型不友善,已難以跟上發展。新推出的 Open TTS Leaderboard 採用客觀自動化指標,評估模型的可理解度(WER/CER)、推論速度(RTFx/TTFA)及聲音相似度(SIM),可在數小時內完成評估。此基準目前聚焦於開源及多語言模型,並設有「聆聽(Listen)」與「串流(Streaming)」功能,讓使用者能直觀比較與測試各模型的實際表現。
核心重點
快速且客觀的自動化評測
將原本需要數週的人工投票評鑑縮短至數小時,透過客觀指標實現大規模、可擴展的 TTS 模型效能評估。
三大核心評估指標
以 Qwen3 ASR 測量字錯率評估可理解度、以 WavLM 餘弦相似度評估聲音複製,並測量 H200 上的批次推論速度。
專為即時語音設計的串流評量
測試首字音訊時間(TTFA),量化在 GPU 與 CPU 上的串流延遲,此指標對即時語音 Agent 至關重要。
聚焦開源與多語言支援
提供多國語言與聲音複製(Voice Cloning)的公平比較,解決了傳統競技場僅有少數開源權重模型的失衡現象。
技術圖解
| 傳統語音競技場 (Voice Arenas) | Open TTS Leaderboard | |
|---|---|---|
| 評估所需時間 | 數週 (Weeks) | 數小時 (Hours) |
| 評鑑標準 | 人類主觀投票 (Human voting) | 客觀自動化指標 (Objective metrics: WER, SIM, TTFA) |
| 開源模型代表性 | 較低 (多數為商業 API 託管) | 極高 (主打並優化開源權重模型) |
| 評測一致性 | 波動大 (投票者主觀標準易變) | 穩定一致 (可重複執行的標準化流程) |
為什麼重要
過去的 TTS 評測過度依賴人工主觀感受(如 MOS 或 Arena 投票),不僅難以標準化,也因託管成本高昂而排擠了開源模型。這項新的評測基準透過自動化指標,大幅降低了評估開源模型效能的時間與資金門檻,能更即時地反映開源社群的創新速度,並為開發即時互動語音 Agent 的開發者提供了極具參考價值的延遲指標。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
- 企業決策者
可以怎麼使用
- 1評估並選擇適合部署至本地端、高性價比的開源多語言 TTS 模型
- 2比較不同模型在 H200 GPU 或 CPU 上的串流延遲(TTFA),以開發低延遲語音 Agent
- 3分析各開源模型在特定非英語語言(如中文、日文、韓文)中的字錯率與複製相似度
限制與注意事項
- 自動化客觀指標僅能作為代理指標,無法完全取代人類對語音自然度與表現力的主觀偏好。
- 多語言測試目前高度依賴特定的資料集(如 Seed TTS Eval 與 CV3 Eval),可能無法完全代表所有真實世界的語境。
延伸閱讀

如何微調 NVIDIA Nemotron 語音辨識模型?以沙烏地阿拉伯方言為例的跨語言適應指南
Fine-Tuning NVIDIA Nemotron ASR for Regional Dialects: A Guide to Dialect Adaptation
本文介紹如何使用 NVIDIA NeMo 框架微調 Nemotron 3.5 ASR 模型,透過輕量數據清理、重播混合與長度分桶等技術,在大幅提升沙烏地阿拉伯方言辨識率的同時,完整保留甚至提升既有的英語與標準阿拉伯語辨識能力。
免訓練提升語音情緒!EmoRES-TTS 透過「殘差向量分解」實現精準可控的語音合成
EmoRES-TTS: Training-Free Residual-Enhanced Vector Steering for Emotional Speech Generation
本研究提出 EmoRES-TTS,透過將情緒引導向量分解為「偏離中性」的共享成分與「特定情緒」的殘差成分,在不需重新訓練模型的情況下,大幅提升文字轉語音(TTS)的情緒表達力與自然度。
聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」
Hearing the Truth: VeriSpeak Exposes the Text-Speech Modality Gap in Fact-Checking
本研究推出首個語音事實查核基準測試 VeriSpeak,揭示大型語音語言模型(LALM)在處理語音陳述時存在「文本-語音模態差距」,並證實結合檢索與顯式推理(如思考微調)能顯著提升查核準確度至 86.1%。