arXivAI 研究
重新審視 METR 時間跨度指標:以統計模型量化 AI 的真實任務能力
Re-Evaluating AI Time Horizons: A Statistical Assessment of the METR Benchmark
本研究利用樣條函數與項目反應理論重新分析 METR 資料集,發現 AI 處理任務的難度與人類時間對數非線性相關,突破 2 至 30 分鐘任務的難度遠低於從 30 分鐘跨越至 5 小時。
2 分鐘閱讀
#item-response-theory
1 篇文章
Re-Evaluating AI Time Horizons: A Statistical Assessment of the METR Benchmark
本研究利用樣條函數與項目反應理論重新分析 METR 資料集,發現 AI 處理任務的難度與人類時間對數非線性相關,突破 2 至 30 分鐘任務的難度遠低於從 30 分鐘跨越至 5 小時。