arXivAI 安全
以「信念自我蒸餾」提取使用者模型:揭示大語言模型對用戶意圖的內在表徵
Extracting User Models via Belief Self-Distillation: How LLMs Form and Use Beliefs About Users
本研究提出「信念自我蒸餾(BSD)」框架,能讀取並寫入大語言模型對使用者的隱含信念,揭示模型如何根據其推測的「使用者意圖」來決定是否拒絕回答,並發現不同模型間存在共享的表徵幾何。
2 分鐘閱讀
#probing
1 篇文章
Extracting User Models via Belief Self-Distillation: How LLMs Form and Use Beliefs About Users
本研究提出「信念自我蒸餾(BSD)」框架,能讀取並寫入大語言模型對使用者的隱含信念,揭示模型如何根據其推測的「使用者意圖」來決定是否拒絕回答,並發現不同模型間存在共享的表徵幾何。