Aivora
arXiv機器人專業

EmbodiedRSI:首個透過「假設引導」實現自主演化與持續學習的機器人框架

EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution

2 分鐘閱讀
EmbodiedRSI:首個透過「假設引導」實現自主演化與持續學習的機器人框架
30 秒看懂

當環境或指令改變時,傳統機器人基礎模型性能常會下降,且依賴高成本的遠端操作(teleoperation)數據來重新訓練。EmbodiedRSI 提出一種自我演化的 Agent 框架,建立「快慢雙系統架構」。慢速系統維護一個「假設圖」,利用「資訊價值(VoI)實驗選擇」挑選最具關鍵性的實體實驗進行驗證。實驗結果會驅動「程式-技能協同演化」並寫入「階層式記憶」,實現無人介入的持續學習。在 RoboCasa365 與真實機器人測試中,皆取得顯著優於傳統基準的成功率。

核心重點

01

快慢雙系統架構

結合負責執行與快速反應的系統,以及負責構建「階層式記憶」與假設生成的慢速系統,平衡即時執行與長期演化。

02

假設圖與 VoI 實驗選擇

維持多個競爭的程式與技能假設,並利用「資訊價值」(Value-of-Information)自主挑選能最有效消除不確定性的實體實驗。

03

程式與技能協同演化

根據實體互動的實際回饋,同步且自主地優化控制程式碼與機器人基礎技能,無需人工撰寫新程式。

04

卓越的跨領域轉移能力

在模擬環境訓練後,可直接「零樣本」(Zero-shot)轉移至實體機器人,在多項挑戰性任務中達到 71.3% 的成功率。

技術圖解

EmbodiedRSI 自主演化流程架構
提供候選假設執行篩選實驗回傳實體物理反饋更新與修正假設固化為成功記憶引導未來快速推理VoI 實驗選擇實體互動探索程式-技能協同演化假設圖 (HypothesisGraph)階層式記憶 (Slow System)

為什麼重要

具身智能(Embodied AI)的一大痛點是數據收集成本極高。EmbodiedRSI 證明了機器人可以像科學家一樣,透過「提出假設、自主實驗、驗證修正」的閉環流程在互動中持續自我演化。這大幅降低了對人類示範與遠端操作數據的依賴,為開發能在未知、動態真實世界中自主適應與 lifelong learning 的機器人提供了全新路徑。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 企業決策者

可以怎麼使用

  1. 1廚房與家用機器人在面對新物品擺設、不熟悉容器或模糊指令時,自主探索並學習正確操作方式。
  2. 2工業機械手臂在面對新產品線與不確定工件時,在無人干預下進行自我調試與技能優化。

限制與注意事項

  • 雖然能自主探索,但在物理世界中的早期探索階段,仍可能因動作不確定性而面臨硬體碰撞與安全風險。
  • 在大規模、超多任務的複雜場景下,維護假設圖與計算資訊價值(VoI)可能會帶來額外的計算開銷。

延伸閱讀

機器造機器:NVIDIA 如何用 AI 與實體控制自動組裝 GB300 測試托盤
NVIDIA Developer機器人

機器造機器:NVIDIA 如何用 AI 與實體控制自動組裝 GB300 測試托盤

The Machines That Make the Machines: How NVIDIA Automates GB300 Tester Tray Assembly

NVIDIA 西雅圖機器人實驗室成功挑戰使用機器手臂組裝複雜的 GB300 晶片測試托盤,揭示了結合傳統控制工程、機械設計與強化學習在實體製造中的關鍵突破。

2 分鐘閱讀