潛在世界模型能預測未來狀態,但其能力如何隨規模增長一直缺乏系統性評估。研究團隊推出史上最大的 JEPA 預測器模型 RoboJEPA(80 億參數),並利用跨 12 種機器人本體的真實資料進行訓練。研究證實其「想像誤差」與算力呈現二階冪法則關係,能精準預測模型品質,且該誤差與實際機器人規劃性能高度相關,甚至支援零樣本長任務規劃。
核心重點
規模化法則確立
「想像誤差」(潛在預測誤差)與算力呈二階冪法則關係,能精準預測更大規模的模型表現。
跨 12 種機器人本體
基於包含 12 種不同機器人硬體本體的大規模真實世界資料進行訓練,具備極佳的泛化能力。
最大的 JEPA 預測器
模型高達 80 億(8B)參數,是目前為止規模最大的 JEPA 架構預測器模型。
零樣本規劃能力
機器人只需給定一張目標圖像,即可在真實硬體上直接規劃並完成長序列任務。
技術圖解
為什麼重要
過去機器人領域缺乏評估世界模型規模化能力的標準,導致難以預測大規模算力的效益。RoboJEPA 證實了「想像誤差」能作為真實機器人表現的可靠指標,讓開發者在無需頻繁進行實體測試的情況下,藉由模擬誤差來預測實體規劃效能,為具身智慧世界模型的規模化發展提供了清晰的路徑圖。
對誰有影響
- AI 研究人員
- AI 開發者
- 企業決策者
可以怎麼使用
- 1目標導向實體規劃:給予機器人完工狀態的單張照片,讓其自主規劃並執行多步驟操作。
- 2跨平台通用機器人控制:利用單一預訓練世界模型,無縫調度與控制不同硬體設計的機器人臂。
限制與注意事項
- 對於缺乏多樣化實體資料與大規模運算資源的團隊,重新訓練與調整此模型的門檻較高。
- 在完全未見過的高動態環境中,零樣本部署的預測準確度可能仍存在不確定性。
延伸閱讀

機器造機器:NVIDIA 如何用 AI 與實體控制自動組裝 GB300 測試托盤
The Machines That Make the Machines: How NVIDIA Automates GB300 Tester Tray Assembly
NVIDIA 西雅圖機器人實驗室成功挑戰使用機器手臂組裝複雜的 GB300 晶片測試托盤,揭示了結合傳統控制工程、機械設計與強化學習在實體製造中的關鍵突破。
Long-WAM:突破即時控制延遲,擴展機器人世界動作模型的長上下文
Long-WAM: Scaling Context for Real-Time World-Action Models
Long-WAM 結合自迴歸預訓練與系統級優化,成功在維持即時控制的前提下,為世界動作模型導入長達 19.2 秒的視覺歷史上下文,大幅提升實體機器人長流程與動態任務的成功率。
機器人控制的「文字敏感症」:為何一個詞能讓 VLA 模型成功率從 100% 跌到 2%?
"Rephrase Before You Act": Mitigating the Extreme Language Sensitivity of Vision-Language-Action Models
研究揭露視覺-語言-動作模型(VLA)對指令措辭極度敏感,並提出一個無需重新訓練模型、透過大型語言模型(LLM)自動提煉重寫規則的零樣本框架,顯著提升機器人任務的成功率。