Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型
Rolling-WAM: Accelerating Robotic World Action Models via Rolling Imagination
傳統的世界動作模型 (WAM) 同時生成動作與未來影像預測,但每次重新規劃時都必須從頭去噪整個預測時間段,帶來極高的延遲,限制了閉環控制效能。Rolling-WAM 提出「滾動想像」機制,在滑動視窗中維護多個處於不同雜訊等級的影像動作區塊。它在當前步驟中僅完全去噪即將執行的動作,並部分精煉未來的預測;隨著視窗推進,這些未來區塊會在後續週期中繼續被去噪。此設計使重新規劃速度提升 4.5 倍,並在 LIBERO、RoboTwin 以及 Unitree G1 真實人形機器人上成功完成多項操作任務。
核心重點
時間分散去噪
打破每次重新規劃皆須從頭去噪的傳統模式,將聯合影像動作的去噪計算分攤至數個連續週期中。
滾動式去噪排程
採用滑動視窗與階梯式雜訊等級,即時去噪當前動作,同時逐步提煉未來區塊的資訊。
4.5 倍重新規劃加速
在維持高水準操縱表現的同時,相較於標準 WAM 實現了 4.5 倍的穩態重新規劃加速。
實體人形機器人驗證
在模擬平台(LIBERO、RoboTwin)以及真實世界的 Unitree G1 雙足人形機器人上完成了實證測試。
技術圖解
| Standard WAM | Rolling-WAM (Ours) | |
|---|---|---|
| 去噪機制 | 每次規劃皆需從頭完整去噪 | 滑動視窗內分階段交錯去噪 |
| 重新規劃延遲 | 高延遲(難以實現閉環即時控制) | 低延遲(達 4.5 倍穩態加速) |
| 未來預測處理 | 捨棄前次預測,全部重新生成 | 保留未來區塊並在後續步驟中持續精煉 |
為什麼重要
世界動作模型(WAM)是具身智慧的核心方向,然而以往極高的生成延遲使其難以在真實硬體上實現即時閉環控制。Rolling-WAM 證明了我們不需要在「未來視覺預測」與「快速動作反應」之間妥協。這項技術解決了去噪延遲的瓶頸,讓具身智慧模型能更實用地部署於需要敏捷、高頻反應的實體人形機器人上。
對誰有影響
- AI 開發者
- AI 研究人員
- 學生與學習者
可以怎麼使用
- 1人形機器人即時操作控制
- 2基於擴散模型的高頻閉環機器人決策
限制與注意事項
- 高度依賴連續、平滑的滑動視窗脈絡,若環境發生突發劇變,可能影響未完全去噪的未來預測。
- 雖然大幅降低延遲,但擴散模型整體的硬體運算需求依然高於簡易的行為複製(Behavioral Cloning)模型。
延伸閱讀
AD-WM:專為反事實預測控制設計的動作辨識世界模型
AD-WM: Action-Discriminative World Models for Counterfactual MPC
AD-WM 透過殘差隱空間動力學與動作恢復正規化,提升世界模型區分不同候選動作的能力,大幅改善機器人的反事實控制與零樣本遷移表現。
RAPID:只需單次視覺示範,AI 代理即可自動生成與優化機器人操控程式
RAPID: Robot Agentic Programming from Demonstrations
RAPID 框架能從單一的人類視覺示範中,自動推導任務規範與模擬環境,並透過編碼代理(Coding Agent)疊代優化出具備強大泛化能力的機器人操控程式。
程式碼生成 Agent 突破機器人規劃瓶頸:自動編寫高泛化性的 TAMP 解決方案
Coding Agents Outperform Hand-Engineered Planners in Task and Motion Planning
研究指出,利用 Claude Code 與 Codex 等程式碼生成 Agent 搭配模擬器互動,能自動編寫出高度泛化的任務與運動規劃(TAMP)程式,在 28 個模擬環境中以最高 95% 的成功率大幅超越傳統手工設計的規劃器。