arXivAI 安全進階
破解 MCP 生態系:新型 A2M 攻擊框架揭示 AI Agent 的語意供應鏈安全威脅
Hijacking MCP Agents: How A2M Exposes Semantic Supply-Chain Risks
30 秒看懂
隨著 Model Context Protocol (MCP) 被廣泛採用,AI Agent 開始頻繁與第三方伺服器工具互動。然而,MCP 主要依賴「語意比對」來選擇工具,這為攻擊者留下了新型供應鏈漏洞。研究人員開發出 A2M (Attraction-to-Manipulation) 黑箱框架,分為兩階段:第一階段優化惡意工具的描述資訊(Metadata)以提高被 Agent 呼叫的機率;第二階段則分析執行軌跡以動態調校回傳內容,進而操縱 Agent 的後續決策,甚至引發認知阻斷服務(Cognitive DoS)。
核心重點
01
語意供應鏈風險
MCP 依賴語意匹配來挑選工具,使得惡意第三方工具只需優化文字描述,就能輕易騙過 Agent 主動調用。
02
雙階段 A2M 框架
分為「吸引(Attraction)」優化詮釋資料,與「操控(Manipulation)」依據執行軌跡調校回傳,達成精準控制。
03
極高的劫持成功率
在對 GLM-4.6 的測試中,惡意工具呼叫率達 93.6%,且在資訊外洩與推理偏移等任務取得 74.4% 的成功率。
04
引發認知阻斷服務
透過操縱工具回傳,能讓 Agent 陷入無效推理或無限循環,使 token 消耗成本暴增至原本的 32.4 倍。
技術圖解
A2M 雙階段劫持工作流程
為什麼重要
這項研究證明,僅依賴 LLM 本身的推理或對齊能力,並不足以防禦精心設計的第三方惡意工具。隨著 MCP(例如被 Claude Desktop 採用的協定)成為串接 Agent 的主流架構,此研究結果逼使開發者必須放棄「完全信任第三方工具描述」的預設假設,轉而採取更嚴格的靜態工具審查與執行期沙盒隔離,這對企業級 Agent 的部署安全有著深遠的指導意義。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1Agent 紅隊演練:利用 A2M 機制對企業內部的 MCP Agent 進行壓力測試,評估其對第三方惡意工具的抵禦能力。
- 2過濾與防禦設計:開發針對 MCP 工具描述(Metadata)的安全防護網,過濾具有高度誘導語意特徵的惡意工具。
限制與注意事項
- 黑箱遷移性在部分非目標優化模型上的攻擊成功率會有所衰退(從 74.4% 降至 24.5%)。
- 若部署環境採用嚴格的動態權限確認與工具描述混淆,可能會大幅增加攻擊難度。