arXivAI 研究
LongHarness Bench:長文本 LLM 外掛機制的效能與效率壓力測試
LongHarness Bench: Stress-Testing Long-Context LLM Harnesses for Efficiency and Reasoning
LongHarness Bench 是一項全新的長文本 LLM 外掛評估基準,同時測試「準確度」與「運算效率」,解決了現有評估指標飽和且難以區分成本差異的問題。
2 分鐘閱讀
#long-context
1 篇文章
LongHarness Bench: Stress-Testing Long-Context LLM Harnesses for Efficiency and Reasoning
LongHarness Bench 是一項全新的長文本 LLM 外掛評估基準,同時測試「準確度」與「運算效率」,解決了現有評估指標飽和且難以區分成本差異的問題。