AI Agent 能建立氣候模型嗎?評估未知科學領域的「SciExam for ENSO」基準測試
SciExam for ENSO: Evaluating AI Agents' Ability to Build Unsolved Climate Models
傳統 AI 評估多依賴標準答案,難以衡量其探索未知科學的能力。研究團隊開發了「SciExam for ENSO」基準測試,給予 AI Agent 6 小時的時間限制,僅能透過自行編寫的診斷程式作為回饋,來建構聖嬰現象(ENSO)的低階隨機模型。在測試的 12 個 Agent 系統中,有 6 個建構出的模型在重建與預測表現上超越了人類已發表的模型,且其模型結構還意外呼應了科學界對於聖嬰現象不對稱性的兩大主流學術爭議。
核心重點
全新評估範式
擺脫傳統「已知標準答案」的局限,改由隱藏評分器(Hidden Graders)針對統計重現、未觀測變數還原及預測能力進行動態評分。
超越人類既有模型
在 12 個受測的 Agent 系統中,有 6 個產生的氣候模型在重建與預測指標上得分高於已發表的學術模型。
觸及科學前沿爭議
Agent 所建構出的優勢模型,其簡化形式分別與科學界解釋聖嬰現象冷熱不對稱性的兩大對立假說相吻合。
非依賴資料記憶
控制組實驗證實,Agent 的優異表現並非來自對歷史觀測資料的記憶,而是取決於建模過程中獲得的即時回饋資訊。
技術圖解
為什麼重要
這項研究證明了 AI Agent 不僅能做已知的「選擇題」,還具備進行真實、開放式科學探索(Open-ended Research)的潛力。當 AI 能夠在缺乏標準答案的環境下,自主建構出可與人類學術水準媲美、甚至能為尚未解決的科學爭議提供線索的物理模型時,這代表 AI 在氣候科學、物理學等複雜系統的科研輔助上邁出了關鍵的一步。
對誰有影響
- AI 研究人員
- AI 開發者
- 企業決策者
可以怎麼使用
- 1自動化氣候預測模型構建:利用 AI Agent 在有限時間內快速篩選與建構特定氣候現象的預測模型。
- 2科學假說驗證與探索:透過 AI 產生的模型結構,輔助科學家分析和驗證複雜物理系統中的潛在理論機制。
限制與注意事項
- 目前僅限於低階(Low-order)隨機氣候模型的建構,尚未推廣至高解析度、全球尺度的大型通用氣候模型。
- Agent 高度依賴自製診斷程式的回饋品質,若初期診斷方向偏頗,可能導致後續建模失敗。
延伸閱讀
打造過目不忘的 3D 空間記憶:Ledger 如何透過第一人稱影片追蹤隱形物體
Building Persistent 3D Object Memory: How Ledger Tracks Objects from Egocentric Videos
普林斯頓等機構的研究人員提出 Ledger 框架,透過第一人稱視角影片為具身智慧助理建立持久的 3D 物體記憶,大幅提升空間定位與問答的準確度。
探索與優化解耦:全新強化學習框架 ExpDis 提升大語言模型的推理多元性
Decoupling Exploration from Optimization: How ExpDis Boosts LLM Reasoning and Solution Diversity
本研究提出 ExpDis 框架,將強化學習中的「探索」與「優化」解耦。透過訓練帶有新穎性獎勵的探索者模型,篩選正確解法並蒸餾至學生模型,解決了傳統 RLVR 因過度探索導致模型退化的難題。
去中心化 SGD 克服重尾雜訊:梯度裁剪如何實現最佳收斂與線性加速
Clipped Decentralized SGD: Achieving Optimal Convergence and Linear Speed-Up Under Heavy-Tailed Noise
本研究證明了在重尾雜訊下,採用梯度裁剪的去中心化 SGD(DSGD)能達到最佳收斂率,並在非凸優化中首次實現了隨節點數量增加的線性加速。