Long-WAM:突破即時控制延遲,擴展機器人世界動作模型的長上下文
Long-WAM: Scaling Context for Real-Time World-Action Models
本研究提出 Long-WAM 模型系統框架,解決了機器人在即時控制下因處理長視覺歷史而產生延遲的痛點。研究團隊發現「擁有歷史不等於會使用它」,只有在基礎視訊模型採用自迴歸(AR)因果預訓練時,長歷史上下文才能顯著提升控制表現。Long-WAM 先從無標記的機器人與第一人稱影片中學習因果預測,並在微調階段保留此結構。配合串流編碼、非同步執行等硬體優化,在 RTX 5090 上推論延遲僅 107.4 毫秒,並在實體 Unitree G1 機器人的動態疊杯任務中取得 95% 的成功率。
核心重點
自迴歸預訓練是解鎖記憶的關鍵
單純增加歷史長度並無幫助,必須在預訓練階段採用自迴歸(AR)因果結構,才能讓模型在微調時真正學會利用長視覺歷史進行精準預測。
上下文長度與成功率顯著正相關
在 RoboCasa GR-1 基準測試中,將視覺上下文長度從 0.0 秒提升至 19.2 秒,任務成功率從 63.3% 顯著躍升至 78.7%。
系統級加速實現即時控制
透過串流觀測值編碼、非同步執行與硬體加速,在 RTX 5090 上每動作區塊(含未來影像預測)的推論時間僅需 107.4 毫秒。
實體機器人動態任務大突破
在 Unitree G1 與 YAM 實體機器人上部署,實現動態疊杯等高難度任務,成功率達 95%,而對比方法 Fast-WAM 與 Pi0.5 則完全失敗。
技術圖解
為什麼重要
過往的機器人動作模型為了維持低延遲控制,往往只接收極短的歷史影像(甚至僅有當前幀),這導致模型在面對長時間、多步驟的長任務,或需要即時反應的動態環境時極易失敗。Long-WAM 突破了這項限制,證明了「有歷史不等於會使用」並指出自迴歸預訓練的必要性,同時透過工程優化使長上下文與即時低延遲並存。這為人形機器人走向日常、工業等複雜且動態的實體操作場景打下重要基礎。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1實體人形機器人(如 Unitree G1)的動態避障與快速精準操控任務(例如動態疊杯)。
- 2長流程與多步驟的複合型機器人操作任務(例如 LIBERO-Long 基準測試中的長任務)。
- 3結合高階規劃器的記憶型底層執行器,提升在未建模環境下的強健度。
限制與注意事項
- 高度依賴高效能硬體(如 RTX 5090、DGX Spark 或 Jetson AGX Thor)來維持超低延遲的串流推論。
- 需要大量無標記的機器人與第一人稱因果視訊資料進行自迴歸預訓練。
延伸閱讀

機器造機器:NVIDIA 如何用 AI 與實體控制自動組裝 GB300 測試托盤
The Machines That Make the Machines: How NVIDIA Automates GB300 Tester Tray Assembly
NVIDIA 西雅圖機器人實驗室成功挑戰使用機器手臂組裝複雜的 GB300 晶片測試托盤,揭示了結合傳統控制工程、機械設計與強化學習在實體製造中的關鍵突破。
機器人控制的「文字敏感症」:為何一個詞能讓 VLA 模型成功率從 100% 跌到 2%?
"Rephrase Before You Act": Mitigating the Extreme Language Sensitivity of Vision-Language-Action Models
研究揭露視覺-語言-動作模型(VLA)對指令措辭極度敏感,並提出一個無需重新訓練模型、透過大型語言模型(LLM)自動提煉重寫規則的零樣本框架,顯著提升機器人任務的成功率。
RoboJEPA:具身智慧的潛在世界模型與規模化法則
RoboJEPA: Scaling Robotic Latent World Models
本研究推出 RoboJEPA,為 80 億參數的機器人潛在世界模型。其基於 JEPA 架構,首次在跨 12 種機器人本體的真實資料上證實了算力與規劃性能的規模化法則。