機器人控制的「文字敏感症」:為何一個詞能讓 VLA 模型成功率從 100% 跌到 2%?
"Rephrase Before You Act": Mitigating the Extreme Language Sensitivity of Vision-Language-Action Models
視覺-語言-動作模型(VLA)常因指令微小變化而失效。例如將「開爐子」改為「開加熱板」,$π_{0.5}$ 模型的成功率竟從 100% 暴跌至 2%。本研究指出此敏感性具有系統性規律,因而開發出「Rephrase Before You Act」框架:先評估少數訓練任務的多種說法,再用 LLM 提煉出 10 到 20 條重寫規則。在部署時,系統會將輸入指令依規則重寫一次後再交給凍結的 VLA 執行。此方法在不修改控制策略、不重新訓練的情況下,將 $π_0$ 模型的相對成功率提升 16% 至 27%。
核心重點
極端的語言敏感性
即使是微小的單詞修改(如將 stove 改為 hot plate),也會導致 VLA 模型的成功率產生數十個百分點的劇烈震盪。
系統性的語言偏好
敏感性並非隨機,可透過 LLM 分析少數訓練任務,將 VLA 的語言偏好提煉為 10 到 20 條明確的重寫規則。
零樣本、無需重新訓練
該框架作為指令預處理器運行,完全不需修改 VLA 策略網路,亦不需進行每步執行驗證。
大幅提升 OOD 泛化能力
透過優化指令措辭,成功縮小了分佈內(ID)與分佈外(OOD)任務之間 21% 的效能差距,顯著改善泛化表現。
技術圖解
為什麼重要
過去為了讓機器人理解多樣化的指令,通常需要進行昂貴的資料搜集與模型微調。這項研究證明,VLA 模型的「語言理解障礙」完全可以透過外部的 LLM 進行翻譯與標準化來解決。這提供了一種極低成本、隨插即用的方案,讓現有的機器人控制策略能直接適應現實世界中人類模糊且多變的口語指令。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1機器人指令預處理系統,將模糊的人類口語即時轉化為機器人高成功率的控制指令。
- 2提升現有 VLA 模型(如 π0 和 π0.5)在未見過(OOD)之任務與環境中的執行成功率。
限制與注意事項
- 規則的提煉依賴外部強大的大型語言模型(LLM),且需要事先對少數訓練任務進行多措辭評估。
- 重寫規則可能無法完美覆蓋所有極端、且高度特異化的新場景語境。
延伸閱讀

機器造機器:NVIDIA 如何用 AI 與實體控制自動組裝 GB300 測試托盤
The Machines That Make the Machines: How NVIDIA Automates GB300 Tester Tray Assembly
NVIDIA 西雅圖機器人實驗室成功挑戰使用機器手臂組裝複雜的 GB300 晶片測試托盤,揭示了結合傳統控制工程、機械設計與強化學習在實體製造中的關鍵突破。
Long-WAM:突破即時控制延遲,擴展機器人世界動作模型的長上下文
Long-WAM: Scaling Context for Real-Time World-Action Models
Long-WAM 結合自迴歸預訓練與系統級優化,成功在維持即時控制的前提下,為世界動作模型導入長達 19.2 秒的視覺歷史上下文,大幅提升實體機器人長流程與動態任務的成功率。
RoboJEPA:具身智慧的潛在世界模型與規模化法則
RoboJEPA: Scaling Robotic Latent World Models
本研究推出 RoboJEPA,為 80 億參數的機器人潛在世界模型。其基於 JEPA 架構,首次在跨 12 種機器人本體的真實資料上證實了算力與規劃性能的規模化法則。