Aivora
Hugging Face語音 AI進階

Hugging Face 推出 Open TTS Leaderboard:多語音合成與聲音複製的開源評測基準

Hugging Face Launches Open TTS Leaderboard for Multilingual TTS and Voice Cloning

2 分鐘閱讀
Hugging Face 推出 Open TTS Leaderboard:多語音合成與聲音複製的開源評測基準
30 秒看懂

隨著 Hugging Face 平台上的語音合成(TTS)模型突破 8,000 個,傳統仰賴人工投票的評測因耗時長、成本高且對開源模型不友善,已難以跟上發展。新推出的 Open TTS Leaderboard 採用客觀自動化指標,評估模型的可理解度(WER/CER)、推論速度(RTFx/TTFA)及聲音相似度(SIM),可在數小時內完成評估。此基準目前聚焦於開源及多語言模型,並設有「聆聽(Listen)」與「串流(Streaming)」功能,讓使用者能直觀比較與測試各模型的實際表現。

核心重點

01

快速且客觀的自動化評測

將原本需要數週的人工投票評鑑縮短至數小時,透過客觀指標實現大規模、可擴展的 TTS 模型效能評估。

02

三大核心評估指標

以 Qwen3 ASR 測量字錯率評估可理解度、以 WavLM 餘弦相似度評估聲音複製,並測量 H200 上的批次推論速度。

03

專為即時語音設計的串流評量

測試首字音訊時間(TTFA),量化在 GPU 與 CPU 上的串流延遲,此指標對即時語音 Agent 至關重要。

04

聚焦開源與多語言支援

提供多國語言與聲音複製(Voice Cloning)的公平比較,解決了傳統競技場僅有少數開源權重模型的失衡現象。

技術圖解

傳統語音競技場 vs. Open TTS Leaderboard 比較
傳統語音競技場 (Voice Arenas)Open TTS Leaderboard
評估所需時間數週 (Weeks)數小時 (Hours)
評鑑標準人類主觀投票 (Human voting)客觀自動化指標 (Objective metrics: WER, SIM, TTFA)
開源模型代表性較低 (多數為商業 API 託管)極高 (主打並優化開源權重模型)
評測一致性波動大 (投票者主觀標準易變)穩定一致 (可重複執行的標準化流程)

為什麼重要

過去的 TTS 評測過度依賴人工主觀感受(如 MOS 或 Arena 投票),不僅難以標準化,也因託管成本高昂而排擠了開源模型。這項新的評測基準透過自動化指標,大幅降低了評估開源模型效能的時間與資金門檻,能更即時地反映開源社群的創新速度,並為開發即時互動語音 Agent 的開發者提供了極具參考價值的延遲指標。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理
  • 企業決策者

可以怎麼使用

  1. 1評估並選擇適合部署至本地端、高性價比的開源多語言 TTS 模型
  2. 2比較不同模型在 H200 GPU 或 CPU 上的串流延遲(TTFA),以開發低延遲語音 Agent
  3. 3分析各開源模型在特定非英語語言(如中文、日文、韓文)中的字錯率與複製相似度

限制與注意事項

  • 自動化客觀指標僅能作為代理指標,無法完全取代人類對語音自然度與表現力的主觀偏好。
  • 多語言測試目前高度依賴特定的資料集(如 Seed TTS Eval 與 CV3 Eval),可能無法完全代表所有真實世界的語境。

延伸閱讀

如何微調 NVIDIA Nemotron 語音辨識模型?以沙烏地阿拉伯方言為例的跨語言適應指南
NVIDIA Developer語音 AI

如何微調 NVIDIA Nemotron 語音辨識模型?以沙烏地阿拉伯方言為例的跨語言適應指南

Fine-Tuning NVIDIA Nemotron ASR for Regional Dialects: A Guide to Dialect Adaptation

本文介紹如何使用 NVIDIA NeMo 框架微調 Nemotron 3.5 ASR 模型,透過輕量數據清理、重播混合與長度分桶等技術,在大幅提升沙烏地阿拉伯方言辨識率的同時,完整保留甚至提升既有的英語與標準阿拉伯語辨識能力。

2 分鐘閱讀
聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」
arXiv語音 AI

聽見真假:VeriSpeak 揭示語音語言模型在事實查核中的「模態差距」

Hearing the Truth: VeriSpeak Exposes the Text-Speech Modality Gap in Fact-Checking

本研究推出首個語音事實查核基準測試 VeriSpeak,揭示大型語音語言模型(LALM)在處理語音陳述時存在「文本-語音模態差距」,並證實結合檢索與顯式推理(如思考微調)能顯著提升查核準確度至 86.1%。

2 分鐘閱讀