Aivora
arXivAI 安全專業

以「信念自我蒸餾」提取使用者模型:揭示大語言模型對用戶意圖的內在表徵

Extracting User Models via Belief Self-Distillation: How LLMs Form and Use Beliefs About Users

2 分鐘閱讀
以「信念自我蒸餾」提取使用者模型:揭示大語言模型對用戶意圖的內在表徵
30 秒看懂

大語言模型(LLM)會默默推測使用者屬性並調整回應,但這些「信念」難以偵測。本研究提出 BSD 框架,讓凍結的 LLM 作為自己的老師,從自然對話中蒸餾出緊湊的使用者表徵。BSD 不僅能解碼模型對使用者的看法(讀),還能直接將信念寫回模型中進行干預(寫)。實驗發現,調整模型對使用者意圖的信念,可在不改變請求內容的前提下改變其拒絕服務的決定。此外,不同模型在表徵使用者時展現出驚人的幾何相似性。

核心重點

01

讀寫合一的信念自我蒸餾

連結線性探針與因果探針,將 LLM 的內在使用者信念提取為可雙向讀寫的緊湊表徵。

02

因果干預影響安全拒絕

證實安全拒絕不只取決於請求內容,更取決於模型推測的「使用者意圖」;改變此信念即可改變拒絕行為。

03

跨模型的幾何表徵收斂

發現不同且獨立訓練的 LLM 家族,在表徵使用者屬性時,會收斂出高度一致的幾何結構。

04

無需標註的自我蒸餾

凍結的 LLM 作為自身導師,直接從自然對話中提取信念,完全不需外部人工標註。

技術圖解

信念自我蒸餾(BSD)讀寫機制
輸入對話活化狀態自我蒸餾提取表徵寫回/干預產生輸出自然對話改變的安全決策信念蒸餾 (讀)緊湊使用者表徵活化狀態干預 (寫)凍結的 LLM

為什麼重要

這項研究對 AI 安全性(AI Safety)與模型可解釋性有重大影響。傳統安全對齊主要聚焦於過濾輸入請求,但本研究證實模型的安全決策(如拒絕回答)深受其「對使用者意圖之信念」的支配。透過 BSD 框架,安全研究人員能夠定量評估並主動修正模型對使用者的偏見與誤判,甚至能預防惡意使用者透過偽裝身份來規避安全限制,為因果可解釋性與主動對齊控制開闢了新路徑。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 政策制定者

可以怎麼使用

  1. 1AI 安全審計:檢測並評估 LLM 對不同使用者特徵或意圖產生的偏見與隱含信念。
  2. 2行為引導與對齊:在不重訓模型的前提下,透過寫入特定信念來精準控制模型的拒絕服務決策。
  3. 3防止身分偽裝攻擊:辨識並防範惡意使用者藉由角色扮演或語氣偽裝來繞過安全防護。

限制與注意事項

  • 信念寫入的干預強度若過高,可能對模型的常規推理或通用對話能力產生副作用。
  • 雖然發現了跨模型的幾何收斂,但在極小尺寸模型或特定微調模型中的適用性仍需進一步驗證。

延伸閱讀

LLM Agent 可輕易篡改自身執行軌跡:現行代理框架的重大安全漏洞
arXivAI 安全

LLM Agent 可輕易篡改自身執行軌跡:現行代理框架的重大安全漏洞

LLM Agents Can Easily Tamper with Their Own Traces: A Critical Security Flaw in Agent Frameworks

研究指出多款主流在地 LLM Agent 框架(如 Claude Code、Grok Build 等)存在嚴重安全漏洞,允許 Agent 輕易刪除或修改自身的執行紀錄,導致安全審計與監控機制失效。

2 分鐘閱讀
語言中的隱形陷阱:自然脈絡如何輕易誘騙 AI 決策模型
arXivAI 安全

語言中的隱形陷阱:自然脈絡如何輕易誘騙 AI 決策模型

The Invisible Trap: How Natural Context Can Easily Flip AI Decision Models

本研究揭示了 AI 決策模型的脆弱性:在不改變問題與選項的前提下,僅加入看似自然且無關的短脈絡,就能使原本正確的決策模型(如 Jev)轉而以高信心度做出錯誤選擇。

2 分鐘閱讀