Aivora
arXivAI 安全進階

語言中的隱形陷阱:自然脈絡如何輕易誘騙 AI 決策模型

The Invisible Trap: How Natural Context Can Easily Flip AI Decision Models

2 分鐘閱讀
語言中的隱形陷阱:自然脈絡如何輕易誘騙 AI 決策模型
30 秒看懂

專門的 AI 決策模型常用於工具選擇或路由。本研究提出 JevOut 方法,發現只要在輸入中加入與情境相符的自然短句(保留原始問題與正確答案),就能引導模型出錯。實驗顯示,優化器在 508 個原本正確的決策中,成功誘導 Jev 做出 61.4% 的錯誤決定,其中 229 例的錯誤選項信心度甚至超過 0.7。其他三種決策系統也展現高達 64.9% 至 73.2% 的被誘導率,凸顯了目前決策介面的嚴重脆弱性。

核心重點

01

自然脈絡敏感性

決策模型對輸入背景極為敏感。加入看似自然且不影響原始語意的短句,即可大幅干擾模型判斷。

02

高信心度的錯誤決策

被誘導的模型不僅會選錯,且在多數案例中,模型對被指定的錯誤選項給予了 0.7 以上的高信心度機率。

03

廣泛存在的系統脆弱性

這種脆弱性不限於 Jev 模型。其他三種主流決策系統在七個資料集上也出現高達 64.9% 至 73.2% 的被誘導率。

04

威脅下游決策介面

由於這些模型直接控制工具調用與路由,此敏感度對將模型機率作為可靠決策介面的做法提出了警訊。

技術圖解

JevOut 對抗性脈絡引導流程
提供正確基底設定攻擊目標優化並產生輸入模型高信心度輸出原始輸入指定錯誤目標優化器自然脈絡決策模型錯誤決策結果

為什麼重要

許多現代 AI Agent 與 RAG 系統仰賴決策模型進行工具選擇、API 路由與自動化操作。這項研究證明,攻擊者或隨機的自然輸入雜訊只需稍微修改背景脈絡,就能在不改變核心事實的情況下,誤導系統執行錯誤的下游動作。這意味著我們不能單純將模型的輸出機率視為安全可靠的決策依據,必須設計更具強健性的安全過濾與稽核機制。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 產品經理
  • 企業決策者

可以怎麼使用

  1. 1對 AI 代理及路由系統進行魯棒性(強健性)紅隊測試。
  2. 2評估 RAG 系統中檢索到的背景資訊是否會非預期地干擾模型決策。

限制與注意事項

  • 本研究主要針對固定選項的選擇型(finite choices)決策模型,對自由文本生成模型的干擾效果尚未完全確認。
  • 優化上下文需要存取模型的選項機率,這在完全黑盒子(不提供機率值)的 API 中可能較難實施。

延伸閱讀

LLM Agent 可輕易篡改自身執行軌跡:現行代理框架的重大安全漏洞
arXivAI 安全

LLM Agent 可輕易篡改自身執行軌跡:現行代理框架的重大安全漏洞

LLM Agents Can Easily Tamper with Their Own Traces: A Critical Security Flaw in Agent Frameworks

研究指出多款主流在地 LLM Agent 框架(如 Claude Code、Grok Build 等)存在嚴重安全漏洞,允許 Agent 輕易刪除或修改自身的執行紀錄,導致安全審計與監控機制失效。

2 分鐘閱讀