arXivAI Safety
Beyond Single-Pair Comparison: Robust Stereotype Evaluation in LLMs via Dual Minimal Pairs
大型語言模型偏見評估新突破:引入雙重極小對立組與互資訊指標
This paper addresses the instability of traditional LLM bias evaluation by proposing a dual minimal pair framework and a Mutual Information-based metric for robust, cross-lingual stereotype measurements.
2 min read