Aivora
arXiv語音 AI專業

WorldSonus:為虛擬世界模型注入即時且具空間感的立體聲

WorldSonus: Bringing Real-Time Spatial Audio to World Models

2 分鐘閱讀
WorldSonus:為虛擬世界模型注入即時且具空間感的立體聲
30 秒看懂

現有的世界模型在視覺生成上已非常逼真,卻大多處於無聲狀態。WorldSonus 為此克服了即時性、互動控制與空間對齊三大挑戰。該研究提出一種串流因果自迴歸擴散架構,使音訊區塊的合成達到僅 0.41 的低即時因子(RTF);同時,透過區塊索引提示排程,讓使用者能在生成中途動態輸入聲音指令。最後,利用立體聲與一階環繞聲資料的監督訓練,使生成音效能精準契合鏡頭移動與場景幾何。

核心重點

01

低延遲串流生成

採用因果自迴歸擴散架構,能以區塊(chunk)為單位快速合成音訊,即時因子(RTF)僅為 0.41。

02

中途動態互動控制

利用音訊核心標註管道與區塊索引提示排程,允許使用者在音訊生成過程中隨時加入新指令。

03

空間幾何對齊

結合立體聲與環繞音訊(ambisonic)進行訓練,確保聲音定位能跟隨鏡頭與物體運動。

技術圖解

WorldSonus 互動式空間音訊合成架構
提供場景幾何中途動態指令RTF 0.41 串流合成輸出立體聲軌影片與運動輸入區塊索引提示詞因果自迴歸擴散模型即時音訊區塊對齊空間之立體聲

為什麼重要

傳統的影片轉音訊(V2A)技術多為非即時且缺乏互動性。WorldSonus 不僅解決了即時運算瓶頸,還引入了即時文字指令控制與精準的立體聲定位,對於需要高沉浸感的虛擬環境、模擬器與遊戲世界模型而言,是實現多模態互動的關鍵技術突破。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 內容創作者

可以怎麼使用

  1. 1遊戲與 3D 虛擬世界生成中的即時音效伴奏
  2. 2具備鏡頭追蹤與空間感知的模擬器音訊生成
  3. 3影片後製中允許中途調整提示詞的動態音效配音

限制與注意事項

  • 高度依賴高品質的立體聲與一階環繞聲(Ambisonics)訓練資料。
  • 作為自迴歸擴散架構,在極長時段的合成中仍可能面臨潛在的誤差累積風險。

延伸閱讀

如何微調 NVIDIA Nemotron 語音辨識模型?以沙烏地阿拉伯方言為例的跨語言適應指南
NVIDIA Developer語音 AI

如何微調 NVIDIA Nemotron 語音辨識模型?以沙烏地阿拉伯方言為例的跨語言適應指南

Fine-Tuning NVIDIA Nemotron ASR for Regional Dialects: A Guide to Dialect Adaptation

本文介紹如何使用 NVIDIA NeMo 框架微調 Nemotron 3.5 ASR 模型,透過輕量數據清理、重播混合與長度分桶等技術,在大幅提升沙烏地阿拉伯方言辨識率的同時,完整保留甚至提升既有的英語與標準阿拉伯語辨識能力。

2 分鐘閱讀