arXivAI 安全
大型語言模型偏見評估新突破:引入雙重極小對立組與互資訊指標
Beyond Single-Pair Comparison: Robust Stereotype Evaluation in LLMs via Dual Minimal Pairs
本研究指出傳統 LLM 偏見評估因「單一對立句」而缺乏穩定性,並提出「雙重極小對立組」框架與互資訊(MI)指標,實現更可靠的跨語言偏見度量。
2 分鐘閱讀
#nlp
1 篇文章
Beyond Single-Pair Comparison: Robust Stereotype Evaluation in LLMs via Dual Minimal Pairs
本研究指出傳統 LLM 偏見評估因「單一對立句」而缺乏穩定性,並提出「雙重極小對立組」框架與互資訊(MI)指標,實現更可靠的跨語言偏見度量。