RAPID:只需單次視覺示範,AI 代理即可自動生成與優化機器人操控程式
RAPID: Robot Agentic Programming from Demonstrations
傳統機器人程式設計需要繁瑣的手工編碼與軌跡調校。RAPID 引入了「機器人代理程式設計」概念,僅需觀看一次人類的視覺操作影片,就能自動推導出三項關鍵要素:測試規範、動作原語與模擬驗證環境。接著,它利用編碼代理在模擬中執行、驗證並疊代修正程式碼。透過「以物件為中心的關係關係程式表示法」,RAPID 將動作轉化為動態的軌跡優化約束,成功在模擬與實體 Franka 機械手臂上實現了能應對物體位置、形狀與材質變化的泛化操控。
核心重點
單次示範自動推導
僅需單次人類操作影片,即可自動提取任務規格、可用動作原語與驗證環境,無須人工撰寫測試代碼。
代理型疊代程式優化
利用 LLM 編碼代理在自動生成的模擬環境中進行「執行-驗證-修正」的閉環疊代,確保程式碼正確性。
以物件為中心的泛化
聚焦於操作策略的幾何關係與運動效果,而非固定軌跡,使程式能彈性適應不同的物件形狀與擺放位置。
技術圖解
為什麼重要
這項研究證明了「程式碼」是極佳的通用機器人表徵,並成功將 LLM 的程式編寫能力與物理世界的機器人控制結合。透過自動化的『生成-驗證-修正』閉環,機器人能自主學會複雜、接觸密集的非抓握任務(如推、滑動),並直接部署於真實世界的機械手臂,顯著降低了機器人技能獲取的門檻與人工開發成本。
對誰有影響
- AI 開發者
- AI 研究人員
- 學生與學習者
可以怎麼使用
- 1接觸密集型非抓握操控:如推動、滑動或翻轉不規則形狀的物體。
- 2跨場景技能遷移:在物體外觀、材質或初始擺放位置改變時,自動優化並執行機器人任務。
限制與注意事項
- 極度依賴視覺示範的品質,若關鍵操作發生嚴重遮擋,可能導致規格或幾何約束推導失敗。
- 模擬環境與真實世界之間仍存在物理差距(Sim-to-Real gap),可能影響部分極精密軌跡的部署表現。
延伸閱讀
AD-WM:專為反事實預測控制設計的動作辨識世界模型
AD-WM: Action-Discriminative World Models for Counterfactual MPC
AD-WM 透過殘差隱空間動力學與動作恢復正規化,提升世界模型區分不同候選動作的能力,大幅改善機器人的反事實控制與零樣本遷移表現。
Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型
Rolling-WAM: Accelerating Robotic World Action Models via Rolling Imagination
Rolling-WAM 透過將影像動作的去噪過程分散至滑動視窗與多個連續規劃週期中,消除從頭去噪的運算瓶頸,實現了 4.5 倍的重新規劃加速,顯著提升人形機器人的即時閉環響應能力。
程式碼生成 Agent 突破機器人規劃瓶頸:自動編寫高泛化性的 TAMP 解決方案
Coding Agents Outperform Hand-Engineered Planners in Task and Motion Planning
研究指出,利用 Claude Code 與 Codex 等程式碼生成 Agent 搭配模擬器互動,能自動編寫出高度泛化的任務與運動規劃(TAMP)程式,在 28 個模擬環境中以最高 95% 的成功率大幅超越傳統手工設計的規劃器。