Aivora

#long-context

Long Context

1 篇文章

LongHarness Bench:長文本 LLM 外掛機制的效能與效率壓力測試
arXivAI 研究

LongHarness Bench:長文本 LLM 外掛機制的效能與效率壓力測試

LongHarness Bench: Stress-Testing Long-Context LLM Harnesses for Efficiency and Reasoning

LongHarness Bench 是一項全新的長文本 LLM 外掛評估基準,同時測試「準確度」與「運算效率」,解決了現有評估指標飽和且難以區分成本差異的問題。

2 分鐘閱讀