Aivora

AI Daily ·

機器人學習與決策安全面臨新挑戰

Today’s AI Highlights

今日AI焦點聚焦於機器人技術與決策模型的最新突破與隱憂。研究指出,具身強化學習中的策略梯度可能洩漏私密軌跡,同時自然上下文也能輕易翻轉AI決策。在正面進展方面,RAPID框架透過單一視覺示範自動化編程,而編碼代理則在任務與動作規劃(TAMP)中超越了手動設計的規劃器。

  1. 具身強化學習的隱私危機:TRACE 演算法僅憑「策略梯度」即可重建機器人私密軌跡
    01arXivAI 安全

    具身強化學習的隱私危機:TRACE 演算法僅憑「策略梯度」即可重建機器人私密軌跡

    在分散式具身強化學習(Embodied RL)中,通常認為只要將原始感測資料留在裝置端、僅上傳「策略梯度」即可保護隱私。然而,本研究提出 TRACE 攻擊法,利用相鄰梯度間的「跨時間相關性」以及策略標頭梯度的閉合解特性,實現了自迴歸的軌跡重建。實驗證實,TRACE 在重建單影格僅需 3 至 4.5 毫秒,影像重建品質達 18.8 dB PSNR,且能近乎完美地復原動作,凸顯出目前隱私防護手段的不足。

  2. RAPID:只需單次視覺示範,AI 代理即可自動生成與優化機器人操控程式
    02arXiv機器人

    RAPID:只需單次視覺示範,AI 代理即可自動生成與優化機器人操控程式

    傳統機器人程式設計需要繁瑣的手工編碼與軌跡調校。RAPID 引入了「機器人代理程式設計」概念,僅需觀看一次人類的視覺操作影片,就能自動推導出三項關鍵要素:測試規範、動作原語與模擬驗證環境。接著,它利用編碼代理在模擬中執行、驗證並疊代修正程式碼。透過「以物件為中心的關係關係程式表示法」,RAPID 將動作轉化為動態的軌跡優化約束,成功在模擬與實體 Franka 機械手臂上實現了能應對物體位置、形狀與材質變化的泛化操控。

  3. 程式碼生成 Agent 突破機器人規劃瓶頸:自動編寫高泛化性的 TAMP 解決方案
    03arXiv機器人

    程式碼生成 Agent 突破機器人規劃瓶頸:自動編寫高泛化性的 TAMP 解決方案

    任務與運動規劃(TAMP)因涉及物理、幾何與動態限制,其泛化難度極高。本研究利用 Claude Code (Opus 5) 與 Codex (GPT-5.6 Sol, GPT-6 Astra) 等程式碼生成 Agent,在 KinDER 和 PDDLStream 的 28 個模擬環境中自動合成 TAMP 程式。Agent 透過與模擬器互動來調校模型並修正程式,最終在未見過的測試實例中進行 98,000 次評估。結果顯示,Agent 程式的平均成功率高達 56% 至 95%,遠優於傳統規劃器的 47%,且在物體數量增加時展現極佳的擴充性,平均運算成本降低了一個數量級。

  4. 不需重新訓練!PoEM 演算法直接預測新獎勵函數的強化學習結果
    04arXivAI 研究

    不需重新訓練!PoEM 演算法直接預測新獎勵函數的強化學習結果

    強化學習(RL)後訓練是讓 AI 模型對齊人類偏好的關鍵,但過程極耗算力且不穩定。麻省理工學院(MIT)團隊提出 PoEM 框架。他們發現,若新獎勵函數是現有獎勵的線性組合,其對應的新模型對數策略(log-policies)也會是現有模型對數策略的線性組合。即使非線性,這些策略在對數空間中仍呈現低秩特性。PoEM 僅需評估樣本,即可直接合成新模型的權重,完全省去重新進行 RL 訓練的昂貴成本。

  5. AD-WM:專為反事實預測控制設計的動作辨識世界模型
    05arXiv機器人

    AD-WM:專為反事實預測控制設計的動作辨識世界模型

    傳統世界模型主要被訓練來預測「已發生」的真實狀態轉移,但在模型預測控制(MPC)中,決策演算法必須評估同一個狀態下多個「反事實(未發生)」候選動作的後果。AD-WM 提出了一種新型的動作辨識聯合嵌入世界模型,結合殘差隱空間動力學與基於條件互資訊的動作恢復正規化。實驗顯示,AD-WM 將 OGBench-Cube 的硬啟動成功率從 3.7% 提升至 52.0%,並在無需任何實驗室特定微調的情況下,將實體 Franka 機械手臂的零樣本揀放成功率從 42.2% 提高至 71.1%。

  6. Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型
    06arXiv機器人

    Rolling-WAM:利用滾動想像實現高效控制的機器人世界動作模型

    傳統的世界動作模型 (WAM) 同時生成動作與未來影像預測,但每次重新規劃時都必須從頭去噪整個預測時間段,帶來極高的延遲,限制了閉環控制效能。Rolling-WAM 提出「滾動想像」機制,在滑動視窗中維護多個處於不同雜訊等級的影像動作區塊。它在當前步驟中僅完全去噪即將執行的動作,並部分精煉未來的預測;隨著視窗推進,這些未來區塊會在後續週期中繼續被去噪。此設計使重新規劃速度提升 4.5 倍,並在 LIBERO、RoboTwin 以及 Unitree G1 真實人形機器人上成功完成多項操作任務。

  7. 語言中的隱形陷阱:自然脈絡如何輕易誘騙 AI 決策模型
    07arXivAI 安全

    語言中的隱形陷阱:自然脈絡如何輕易誘騙 AI 決策模型

    專門的 AI 決策模型常用於工具選擇或路由。本研究提出 JevOut 方法,發現只要在輸入中加入與情境相符的自然短句(保留原始問題與正確答案),就能引導模型出錯。實驗顯示,優化器在 508 個原本正確的決策中,成功誘導 Jev 做出 61.4% 的錯誤決定,其中 229 例的錯誤選項信心度甚至超過 0.7。其他三種決策系統也展現高達 64.9% 至 73.2% 的被誘導率,凸顯了目前決策介面的嚴重脆弱性。

過往日報