Aivora
arXiv機器人專業

RAPID:只需單次視覺示範,AI 代理即可自動生成與優化機器人操控程式

RAPID: Robot Agentic Programming from Demonstrations

2 分鐘閱讀
RAPID:只需單次視覺示範,AI 代理即可自動生成與優化機器人操控程式
30 秒看懂

傳統機器人程式設計需要繁瑣的手工編碼與軌跡調校。RAPID 引入了「機器人代理程式設計」概念,僅需觀看一次人類的視覺操作影片,就能自動推導出三項關鍵要素:測試規範、動作原語與模擬驗證環境。接著,它利用編碼代理在模擬中執行、驗證並疊代修正程式碼。透過「以物件為中心的關係關係程式表示法」,RAPID 將動作轉化為動態的軌跡優化約束,成功在模擬與實體 Franka 機械手臂上實現了能應對物體位置、形狀與材質變化的泛化操控。

核心重點

01

單次示範自動推導

僅需單次人類操作影片,即可自動提取任務規格、可用動作原語與驗證環境,無須人工撰寫測試代碼。

02

代理型疊代程式優化

利用 LLM 編碼代理在自動生成的模擬環境中進行「執行-驗證-修正」的閉環疊代,確保程式碼正確性。

03

以物件為中心的泛化

聚焦於操作策略的幾何關係與運動效果,而非固定軌跡,使程式能彈性適應不同的物件形狀與擺放位置。

技術圖解

RAPID 機器人程式自動生成與優化流程
輸入單一影片輸出規範與環境生成測試程式碼失敗:反饋除錯成功:輸出最佳程式視覺人類示範影片自動推導三要素模擬執行與驗證編碼代理 (LLM)真實 Franka 部署

為什麼重要

這項研究證明了「程式碼」是極佳的通用機器人表徵,並成功將 LLM 的程式編寫能力與物理世界的機器人控制結合。透過自動化的『生成-驗證-修正』閉環,機器人能自主學會複雜、接觸密集的非抓握任務(如推、滑動),並直接部署於真實世界的機械手臂,顯著降低了機器人技能獲取的門檻與人工開發成本。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 學生與學習者

可以怎麼使用

  1. 1接觸密集型非抓握操控:如推動、滑動或翻轉不規則形狀的物體。
  2. 2跨場景技能遷移:在物體外觀、材質或初始擺放位置改變時,自動優化並執行機器人任務。

限制與注意事項

  • 極度依賴視覺示範的品質,若關鍵操作發生嚴重遮擋,可能導致規格或幾何約束推導失敗。
  • 模擬環境與真實世界之間仍存在物理差距(Sim-to-Real gap),可能影響部分極精密軌跡的部署表現。

延伸閱讀

AD-WM:專為反事實預測控制設計的動作辨識世界模型
arXiv機器人

AD-WM:專為反事實預測控制設計的動作辨識世界模型

AD-WM: Action-Discriminative World Models for Counterfactual MPC

AD-WM 透過殘差隱空間動力學與動作恢復正規化,提升世界模型區分不同候選動作的能力,大幅改善機器人的反事實控制與零樣本遷移表現。

2 分鐘閱讀
Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型
arXiv機器人

Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型

Rolling-WAM: Accelerating Robotic World Action Models via Rolling Imagination

Rolling-WAM 透過將影像動作的去噪過程分散至滑動視窗與多個連續規劃週期中,消除從頭去噪的運算瓶頸,實現了 4.5 倍的重新規劃加速,顯著提升人形機器人的即時閉環響應能力。

2 分鐘閱讀