EmbodiedRSI:首個透過「假設引導」實現自主演化與持續學習的機器人框架
EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution
當環境或指令改變時,傳統機器人基礎模型性能常會下降,且依賴高成本的遠端操作(teleoperation)數據來重新訓練。EmbodiedRSI 提出一種自我演化的 Agent 框架,建立「快慢雙系統架構」。慢速系統維護一個「假設圖」,利用「資訊價值(VoI)實驗選擇」挑選最具關鍵性的實體實驗進行驗證。實驗結果會驅動「程式-技能協同演化」並寫入「階層式記憶」,實現無人介入的持續學習。在 RoboCasa365 與真實機器人測試中,皆取得顯著優於傳統基準的成功率。
核心重點
快慢雙系統架構
結合負責執行與快速反應的系統,以及負責構建「階層式記憶」與假設生成的慢速系統,平衡即時執行與長期演化。
假設圖與 VoI 實驗選擇
維持多個競爭的程式與技能假設,並利用「資訊價值」(Value-of-Information)自主挑選能最有效消除不確定性的實體實驗。
程式與技能協同演化
根據實體互動的實際回饋,同步且自主地優化控制程式碼與機器人基礎技能,無需人工撰寫新程式。
卓越的跨領域轉移能力
在模擬環境訓練後,可直接「零樣本」(Zero-shot)轉移至實體機器人,在多項挑戰性任務中達到 71.3% 的成功率。
技術圖解
為什麼重要
具身智能(Embodied AI)的一大痛點是數據收集成本極高。EmbodiedRSI 證明了機器人可以像科學家一樣,透過「提出假設、自主實驗、驗證修正」的閉環流程在互動中持續自我演化。這大幅降低了對人類示範與遠端操作數據的依賴,為開發能在未知、動態真實世界中自主適應與 lifelong learning 的機器人提供了全新路徑。
對誰有影響
- AI 研究人員
- AI 開發者
- 企業決策者
可以怎麼使用
- 1廚房與家用機器人在面對新物品擺設、不熟悉容器或模糊指令時,自主探索並學習正確操作方式。
- 2工業機械手臂在面對新產品線與不確定工件時,在無人干預下進行自我調試與技能優化。
限制與注意事項
- 雖然能自主探索,但在物理世界中的早期探索階段,仍可能因動作不確定性而面臨硬體碰撞與安全風險。
- 在大規模、超多任務的複雜場景下,維護假設圖與計算資訊價值(VoI)可能會帶來額外的計算開銷。
延伸閱讀

機器造機器:NVIDIA 如何用 AI 與實體控制自動組裝 GB300 測試托盤
The Machines That Make the Machines: How NVIDIA Automates GB300 Tester Tray Assembly
NVIDIA 西雅圖機器人實驗室成功挑戰使用機器手臂組裝複雜的 GB300 晶片測試托盤,揭示了結合傳統控制工程、機械設計與強化學習在實體製造中的關鍵突破。
Long-WAM:突破即時控制延遲,擴展機器人世界動作模型的長上下文
Long-WAM: Scaling Context for Real-Time World-Action Models
Long-WAM 結合自迴歸預訓練與系統級優化,成功在維持即時控制的前提下,為世界動作模型導入長達 19.2 秒的視覺歷史上下文,大幅提升實體機器人長流程與動態任務的成功率。
機器人控制的「文字敏感症」:為何一個詞能讓 VLA 模型成功率從 100% 跌到 2%?
"Rephrase Before You Act": Mitigating the Extreme Language Sensitivity of Vision-Language-Action Models
研究揭露視覺-語言-動作模型(VLA)對指令措辭極度敏感,並提出一個無需重新訓練模型、透過大型語言模型(LLM)自動提煉重寫規則的零樣本框架,顯著提升機器人任務的成功率。