Aivora
arXiv機器人專業

Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型

Rolling-WAM: Accelerating Robotic World Action Models via Rolling Imagination

2 分鐘閱讀
Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型
30 秒看懂

傳統的世界動作模型 (WAM) 同時生成動作與未來影像預測,但每次重新規劃時都必須從頭去噪整個預測時間段,帶來極高的延遲,限制了閉環控制效能。Rolling-WAM 提出「滾動想像」機制,在滑動視窗中維護多個處於不同雜訊等級的影像動作區塊。它在當前步驟中僅完全去噪即將執行的動作,並部分精煉未來的預測;隨著視窗推進,這些未來區塊會在後續週期中繼續被去噪。此設計使重新規劃速度提升 4.5 倍,並在 LIBERO、RoboTwin 以及 Unitree G1 真實人形機器人上成功完成多項操作任務。

核心重點

01

時間分散去噪

打破每次重新規劃皆須從頭去噪的傳統模式,將聯合影像動作的去噪計算分攤至數個連續週期中。

02

滾動式去噪排程

採用滑動視窗與階梯式雜訊等級,即時去噪當前動作,同時逐步提煉未來區塊的資訊。

03

4.5 倍重新規劃加速

在維持高水準操縱表現的同時,相較於標準 WAM 實現了 4.5 倍的穩態重新規劃加速。

04

實體人形機器人驗證

在模擬平台(LIBERO、RoboTwin)以及真實世界的 Unitree G1 雙足人形機器人上完成了實證測試。

技術圖解

標準 WAM 與 Rolling-WAM 之比較
Standard WAMRolling-WAM (Ours)
去噪機制每次規劃皆需從頭完整去噪滑動視窗內分階段交錯去噪
重新規劃延遲高延遲(難以實現閉環即時控制)低延遲(達 4.5 倍穩態加速)
未來預測處理捨棄前次預測,全部重新生成保留未來區塊並在後續步驟中持續精煉

為什麼重要

世界動作模型(WAM)是具身智慧的核心方向,然而以往極高的生成延遲使其難以在真實硬體上實現即時閉環控制。Rolling-WAM 證明了我們不需要在「未來視覺預測」與「快速動作反應」之間妥協。這項技術解決了去噪延遲的瓶頸,讓具身智慧模型能更實用地部署於需要敏捷、高頻反應的實體人形機器人上。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 學生與學習者

可以怎麼使用

  1. 1人形機器人即時操作控制
  2. 2基於擴散模型的高頻閉環機器人決策

限制與注意事項

  • 高度依賴連續、平滑的滑動視窗脈絡,若環境發生突發劇變,可能影響未完全去噪的未來預測。
  • 雖然大幅降低延遲,但擴散模型整體的硬體運算需求依然高於簡易的行為複製(Behavioral Cloning)模型。

延伸閱讀

AD-WM:專為反事實預測控制設計的動作辨識世界模型
arXiv機器人

AD-WM:專為反事實預測控制設計的動作辨識世界模型

AD-WM: Action-Discriminative World Models for Counterfactual MPC

AD-WM 透過殘差隱空間動力學與動作恢復正規化,提升世界模型區分不同候選動作的能力,大幅改善機器人的反事實控制與零樣本遷移表現。

2 分鐘閱讀