Aivora
arXivAI 安全進階

破解 MCP 生態系:新型 A2M 攻擊框架揭示 AI Agent 的語意供應鏈安全威脅

Hijacking MCP Agents: How A2M Exposes Semantic Supply-Chain Risks

2 分鐘閱讀
破解 MCP 生態系:新型 A2M 攻擊框架揭示 AI Agent 的語意供應鏈安全威脅
30 秒看懂

隨著 Model Context Protocol (MCP) 被廣泛採用,AI Agent 開始頻繁與第三方伺服器工具互動。然而,MCP 主要依賴「語意比對」來選擇工具,這為攻擊者留下了新型供應鏈漏洞。研究人員開發出 A2M (Attraction-to-Manipulation) 黑箱框架,分為兩階段:第一階段優化惡意工具的描述資訊(Metadata)以提高被 Agent 呼叫的機率;第二階段則分析執行軌跡以動態調校回傳內容,進而操縱 Agent 的後續決策,甚至引發認知阻斷服務(Cognitive DoS)。

核心重點

01

語意供應鏈風險

MCP 依賴語意匹配來挑選工具,使得惡意第三方工具只需優化文字描述,就能輕易騙過 Agent 主動調用。

02

雙階段 A2M 框架

分為「吸引(Attraction)」優化詮釋資料,與「操控(Manipulation)」依據執行軌跡調校回傳,達成精準控制。

03

極高的劫持成功率

在對 GLM-4.6 的測試中,惡意工具呼叫率達 93.6%,且在資訊外洩與推理偏移等任務取得 74.4% 的成功率。

04

引發認知阻斷服務

透過操縱工具回傳,能讓 Agent 陷入無效推理或無限循環,使 token 消耗成本暴增至原本的 32.4 倍。

技術圖解

A2M 雙階段劫持工作流程
送出任務語意匹配誘騙調用惡意工具回傳調整引導後續決策達成惡意意圖使用者查詢1. 吸引階段 (詮釋資料優化)3. 操控階段 (執行軌跡優化)MCP Agent / LLM2. 惡意工具伺服器攻擊成功 (資訊外洩/認知DoS)

為什麼重要

這項研究證明,僅依賴 LLM 本身的推理或對齊能力,並不足以防禦精心設計的第三方惡意工具。隨著 MCP(例如被 Claude Desktop 採用的協定)成為串接 Agent 的主流架構,此研究結果逼使開發者必須放棄「完全信任第三方工具描述」的預設假設,轉而採取更嚴格的靜態工具審查與執行期沙盒隔離,這對企業級 Agent 的部署安全有著深遠的指導意義。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1Agent 紅隊演練:利用 A2M 機制對企業內部的 MCP Agent 進行壓力測試,評估其對第三方惡意工具的抵禦能力。
  2. 2過濾與防禦設計:開發針對 MCP 工具描述(Metadata)的安全防護網,過濾具有高度誘導語意特徵的惡意工具。

限制與注意事項

  • 黑箱遷移性在部分非目標優化模型上的攻擊成功率會有所衰退(從 74.4% 降至 24.5%)。
  • 若部署環境採用嚴格的動態權限確認與工具描述混淆,可能會大幅增加攻擊難度。