DepthWorld:為機器人操控打造的 3D 世界模型
DepthWorld: 3D World Model for Robot Manipulation
傳統世界模型僅使用 RGB 視訊訓練,生成的畫面雖合乎常理,卻缺乏穩定的 3D 幾何結構。研究團隊提出一套標定管線,將 DROID 資料集升級為高精度的 DROID-3D 資料集。並以此訓練 DepthWorld 模型,在不改變預訓練 VAE 的情況下,透過空間潛在平貼同時預測多視角 RGB 與深度,不僅讓 RGB 預測品質提升 1.48 dB PSNR,更提供精準的度量深度以供機器人進行幾何推理。
核心重點
DROID-3D 標定資料集
結合學習型立體深度與聯合因子圖,從小樣本中復原物理相機參數,達到小於 0.7 像素的重投影誤差。
空間潛在平貼技術
基於 Stable Video Diffusion 基礎,在保留預訓練 VAE 的前提下,同步且一致地預測多視角與深度圖。
深度監督反饋 RGB
引入深度監督使 RGB 預測品質相較純 RGB 基準模型提升了 1.48 dB PSNR,展現跨模態互補優勢。
技術圖解
為什麼重要
機器人決策(如路徑規劃與策略評估)極度依賴精確的 3D 空間結構。以往的視訊模型容易出現「畫面好看但空間扭曲」的幾何缺陷。DepthWorld 證明了引入深度監督不僅能直接輸出精準的度量深度,還能同步提高視覺畫面的生成品質,為具身智慧(Embodied AI)提供了更為逼真、具備物理一致性的虛擬沙盒。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1機器人操控策略評估與規劃
- 2高保真 3D 物理與環境模擬
限制與注意事項
- 高度依賴特定的標定管線來生成初始 3D 資料集的深度與外參資訊。
- 多視角與深度的聯合擴散計算可能帶來較高的硬體運算開銷。
延伸閱讀
QF3:利用過濾 Q 梯度實現快速流匹配強化學習的機器人控制技術
QF3: Fast Flow RL with Filtered Q-Gradients
介紹 QF3 演算法,這是一種全新的離策略強化學習方法,將人形機器人運動訓練速度提升 10 倍,並首度實現從零訓練且零樣本轉移至實體硬體。
VeriFine:透過協同演化驗證機制實現具身智慧的自我迭代
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
VeriFine 是一個針對具身推理的 Agent 架構,透過「策略優化」與「裁判優化」雙循環,讓模型策略與驗證裁判協同演化,打破傳統固定裁判帶來的優化瓶頸。
EyeRobot 2.0:無需手腕相機,用「主動注視」實現精準雙手機器人操控
EyeRobot 2.0: Precise Robot Manipulation via Active Gaze Without Wrist Cameras
EyeRobot 2.0 模仿人類視覺,僅靠單一雙目相機與主動注視機制,即可在無需手腕相機的情況下,實現高精度的雙手協調操作。