Aivora
arXivAI 安全進階

大型語言模型偏見評估新突破:引入雙重極小對立組與互資訊指標

Beyond Single-Pair Comparison: Robust Stereotype Evaluation in LLMs via Dual Minimal Pairs

2 分鐘閱讀
大型語言模型偏見評估新突破:引入雙重極小對立組與互資訊指標
30 秒看懂

評估大型語言模型的偏見時,傳統方法常直接比較一對對立句子的對數概似度。然而,這容易因詞彙微調而產生邏輯不一致的結果。本研究提出「雙重極小對立組」評估框架,引進兩個維度的比較軸線。研究團隊透過資料增強自動生成釋義與備選屬性,補足現有資料集缺口,並在英文、中文、西班牙文與俄文上進行驗證。此外,本研究也引入以互資訊(MI)為核心的新指標,能更好地進行數據聚合,讓跨模型、跨語言的偏見強度對比更加穩定可靠。

核心重點

01

傳統單一對立評估的不穩定性

僅比較單一對立句子的對數概似度,容易因為句子中屬性的微小改寫,就導致模型偏好出現邏輯不一致。

02

創新的雙重極小對立組框架

引入兩個維度的比較軸線(雙重對立),提供更穩固、全面且能抵抗邏輯不一致的評估基準。

03

多語言資料增強

開發自動化增強框架來生成釋義與交替屬性,並在英、中、西、俄四種語言的模型中進行實證。

04

基於互資訊的新評估指標

提出互資訊(MI)指標來衡量社會群體與刻板屬性之間的關係,方便在不同語言和模型間進行公平的強度對比。

技術圖解

單一對立組與雙重極小對立組評估法比較
單一對立組評估 (Single-Pair)雙重極小對立組評估 (Dual Minimal Pair)
比較軸線單一軸線 (比較兩句對立刻板句)雙重軸線 (結合釋義與交替屬性)
邏輯一致性較差,容易因重寫屬性而產生矛盾偏好較高,透過多維度對照抵抗局部語法擾動
核心評估指標單純對數概似度 (Log-likelihood)互資訊 (MI) 聚合指標
跨模型比較能力低,難以在不同基準線下進行穩定聚合高,適合進行不同語言與架構間的偏見強度對比

為什麼重要

目前的 AI 偏見基準測試高度依賴特定句型,微小的文字異動就可能導致評估失準,讓開發者誤判模型的安全性。本研究提出的雙重極小對立組框架與互資訊指標,克服了傳統單一對立句容易「邏輯打架」的缺點。此方法能提供客觀、具備跨語言通用性的測量工具,對未來更公平、更安全的 AI 對齊(Alignment)與去偏見(Debiasing)技術發展至關重要。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 產品經理

可以怎麼使用

  1. 1評估與優化語言模型安全對齊(Alignment)的偏見程度
  2. 2跨語言、跨模型架構的偏見與刻板印象基準測試

限制與注意事項

  • 此評估方法與資料增強框架,目前僅在英文、俄文、西班牙文和中文四種語料上進行了驗證。
  • 雖然互資訊指標能更穩定地進行偏見強度的跨模型比較,但其效果依然依賴於生成對立句型時的品質。

延伸閱讀