重新審視 METR 時間跨度指標:以統計模型量化 AI 的真實任務能力
Re-Evaluating AI Time Horizons: A Statistical Assessment of the METR Benchmark
METR 提出的「50% 時間跨度」以 AI 能以 50% 機率勝任的人類任務完成時間作為能力指標。研究團隊針對 228 個任務與 26 個 AI 模型重新擬合模型,打破了「AI 難度與人類完成時間對數成線性關係」的傳統假設。結果顯示,2 到 30 分鐘區間的難度曲線近乎平坦,意即 AI 完成時間翻倍並不代表難度同比例增加。研究團隊提供了精準度更高的估計值與診斷圖表,建議未來評估 AI 長時間任務能力時應搭配圖表進行解讀。
核心重點
非線性難度轉換
研究證實 AI 任務難度與人類時間對數並非線性關係,需透過樣條函數進行非線性轉換。
2-30 分鐘平坦區間
難度轉換函數在 2 至 30 分鐘近乎平坦,使得 AI 時間跨度從 3 分鐘跳躍至 30 分鐘比從 30 分鐘跨越至 5 小時容易許多。
項目反應理論估估
結合項目反應理論(IRT)與樣條模型,顯著提升了交叉驗證下的預測與點估計表現。
引入診斷圖表
建議將時間跨度指標與診斷圖表結合使用,避免在基準擴充至更長任務時產生誤判。
為什麼重要
時間跨度是評估 AI Agent 自動化能力與制定安全政策的核心指標。如果不了解難度曲線的非線性特質,產業界與政策制定者可能會誤判 AI 能力的成長速度,例如過度樂觀估計短任務的進步,或低估解決長時長任務(如數小時以上)所需的技術突破。這項研究為 AI 能力評估帶來更嚴謹的統計基礎。
對誰有影響
- AI 研究人員
- 政策制定者
- 企業決策者
- 產品經理
可以怎麼使用
- 1校正 AI Agent 在軟體開發與複雜任務上的能力評測指標
- 2為 AI 安全監管機構提供更精準的能力門檻與風險評估依據
限制與注意事項
- 分析基於 METR 現有的 228 個軟體任務與 26 個 AI 模型,評估範圍仍受限於該資料集之任務型態。
- 當基準擴展至數小時或數天的超長任務時,模型仍需重新檢驗構面有效性。
延伸閱讀
單一區塊實現多重深度:具備深度編程專家庫的循環 Vision Transformer
One Block, Multiple Depths: Recurrent Vision Transformers with Depth-Programmed Experts
論文提出 reViT 架構,僅利用單一重複使用的 Transformer 區塊,透過動態組合專家權重來模擬不同深度的特徵轉換,在大幅減少 70% 參數量的同時達到與標準全深度模型相當的精準度。
打造過目不忘的 3D 空間記憶:Ledger 如何透過第一人稱影片追蹤隱形物體
Building Persistent 3D Object Memory: How Ledger Tracks Objects from Egocentric Videos
普林斯頓等機構的研究人員提出 Ledger 框架,透過第一人稱視角影片為具身智慧助理建立持久的 3D 物體記憶,大幅提升空間定位與問答的準確度。
探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性
Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity
本研究提出 ExpDis 框架,將強化學習中的「探索」與「優化」解耦。透過訓練帶有新穎性獎勵的探索者模型,篩選正確解法並蒸餾至學生模型,解決了傳統 RLVR 因過度探索導致模型退化的難題。