Aivora
arXiv機器人進階

DepthWorld:為機器人操控打造的 3D 世界模型

DepthWorld: 3D World Model for Robot Manipulation

2 分鐘閱讀
DepthWorld:為機器人操控打造的 3D 世界模型
30 秒看懂

傳統世界模型僅使用 RGB 視訊訓練,生成的畫面雖合乎常理,卻缺乏穩定的 3D 幾何結構。研究團隊提出一套標定管線,將 DROID 資料集升級為高精度的 DROID-3D 資料集。並以此訓練 DepthWorld 模型,在不改變預訓練 VAE 的情況下,透過空間潛在平貼同時預測多視角 RGB 與深度,不僅讓 RGB 預測品質提升 1.48 dB PSNR,更提供精準的度量深度以供機器人進行幾何推理。

核心重點

01

DROID-3D 標定資料集

結合學習型立體深度與聯合因子圖,從小樣本中復原物理相機參數,達到小於 0.7 像素的重投影誤差。

02

空間潛在平貼技術

基於 Stable Video Diffusion 基礎,在保留預訓練 VAE 的前提下,同步且一致地預測多視角與深度圖。

03

深度監督反饋 RGB

引入深度監督使 RGB 預測品質相較純 RGB 基準模型提升了 1.48 dB PSNR,展現跨模態互補優勢。

技術圖解

DepthWorld 訓練與推理流程
輸入管線產出 3D 標定資料潛在平貼聯合訓練預測輸出原始 DROID 視訊因子圖外參標定DROID-3D 深度資料DepthWorld 擴散模型一致的多視角 RGB + 深度

為什麼重要

機器人決策(如路徑規劃與策略評估)極度依賴精確的 3D 空間結構。以往的視訊模型容易出現「畫面好看但空間扭曲」的幾何缺陷。DepthWorld 證明了引入深度監督不僅能直接輸出精準的度量深度,還能同步提高視覺畫面的生成品質,為具身智慧(Embodied AI)提供了更為逼真、具備物理一致性的虛擬沙盒。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1機器人操控策略評估與規劃
  2. 2高保真 3D 物理與環境模擬

限制與注意事項

  • 高度依賴特定的標定管線來生成初始 3D 資料集的深度與外參資訊。
  • 多視角與深度的聯合擴散計算可能帶來較高的硬體運算開銷。

延伸閱讀

VeriFine:透過協同演化驗證機制實現具身智慧的自我迭代
arXiv機器人

VeriFine:透過協同演化驗證機制實現具身智慧的自我迭代

VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning

VeriFine 是一個針對具身推理的 Agent 架構,透過「策略優化」與「裁判優化」雙循環,讓模型策略與驗證裁判協同演化,打破傳統固定裁判帶來的優化瓶頸。

2 分鐘閱讀