arXivAI 程式開發
自動漏洞修復的指標迷思:為何「編譯率」與 CodeBLEU 無法真實反映 LLM 的修復能力
The Illusion of Compile Rate: Why Common Metrics Fail LLM-Based Vulnerability Repair
一項針對 C/C++ 漏洞修復的研究指出,常用的評估指標「編譯率」與 CodeBLEU 存在嚴重缺陷,甚至會獎勵「刪除程式碼」等規避式修復;研究團隊為此提出 diff_F1 作為更可靠的變更感知篩選工具。
2 分鐘閱讀