超大規模機器人強化學習的平衡數據飲食:成功引導採樣 SGS
A Balanced Data Diet: Success Guided Sampling for Mega-Scale Robot RL
傳統超大規模平行模擬強化學習採用均勻重置採樣,容易在已精通或過於困難的任務配置上浪費大量學習信號。研究團隊提出「成功引導採樣(SGS)」,讓模擬器動態調整任務配置的重置機率,專注於策略能力邊界上的任務。在多達 2^20(超過 100 萬)個平行環境的實驗中,SGS 成功解決了多地形四足行走與高接觸精密組裝任務,並將策略蒸餾為 RGB 視覺策略,實現真實機器人上的零樣本轉移。
核心重點
解決平行 RL 的探索瓶頸
單純擴展平行環境並搭配均勻採樣重置,會將大部分批次經驗浪費在極端簡單或無法完成的任務上。
成功引導採樣(SGS)
SGS 是一種自適應採樣器,能動態集中訓練於策略能力邊界上的任務配置,大幅提升學習效率。
擴展至百萬平行環境
在多達 2^20(超過 100 萬)個平行環境中進行驗證,成功解決傳統方法無法應對的高難度多地形與接觸式組裝任務。
實機零樣本部署
將訓練好的操控策略蒸餾至基於 RGB 影像的策略,成功在真實機器人硬體上進行零樣本跨領域轉移。
技術圖解
為什麼重要
隨著物理模擬器支援的平行環境數量跨入百萬層級,如何有效率地利用這些生成的資料成為關鍵瓶頸。SGS 降低了強化學習對人工設計獎勵函數與示範資料(Demonstration)的依賴。透過自適應聚焦訓練邊界,SGS 讓超大規模強化學習能發揮預期的算力擴展效應,為通用機器人在多變環境下的移動與精密操控提供了突破性的資料調配方案。
對誰有影響
- AI 研究人員
- AI 開發者
- 學生與學習者
可以怎麼使用
- 1多地形適應之四足機器人敏捷行走控制
- 2高接觸、高精度的機械手臂物件組裝任務
- 3超大規模平行模擬環境中的訓練資源自適應分配
限制與注意事項
- 需模擬器支援動態任務配置重置與即時成功率追蹤機制。
- 真實硬體的成功率仍取決於蒸餾至 RGB 視覺策略時的 Sim-to-Real 差距。
延伸閱讀

5 步驟建構 SimReady 機器人資產:結合前沿 AI 模型與 NVIDIA Omniverse
5 Steps to Build SimReady Robotics Assets with Frontier AI Models
本文介紹如何利用 GPT-6 Astra 等前沿 AI 模型搭配 NVIDIA Omniverse 與 Isaac Sim,透過 5 個步驟自動將 CAD 檔案轉換、配置並驗證為具備真實物理屬性的 SimReady 機器人模擬資產。
CSF:結合場景語境的機器人動作生成安全過濾技術
CSF: Contextual Safety Filtering for Text-Conditioned Motion Generators
CSF 是一個免訓練的安全過濾架構,結合 Control Barrier Function 與場景語境,使機器人動作生成模型能自動依環境調整並防止危險動作。

機器造機器:NVIDIA 如何用 AI 與實體控制自動組裝 GB300 測試托盤
The Machines That Make the Machines: How NVIDIA Automates GB300 Tester Tray Assembly
NVIDIA 西雅圖機器人實驗室成功挑戰使用機器手臂組裝複雜的 GB300 晶片測試托盤,揭示了結合傳統控制工程、機械設計與強化學習在實體製造中的關鍵突破。