Cogentic:用於自動化定理證明發現的多 Agent 協調框架
Cogentic: Multi-Agent Orchestration for Automated Proof Discovery
單次生成(Single-shot)的 LLM 在面對需要長期推導、探索多個競爭猜想的複雜數學難題時往往力有未逮。為此,研究團隊開發了 Cogentic 框架。該框架由「協調器」調度多個獨立的「證明 Agent」往不同方向探索,並由多個專門的「驗證元件」進行對抗式審查。通過驗證的中間結果會寫入「持續性驗證帳本」中,供後續迭代推進。以 Gemini 為底座,Cogentic 已成功在線上學習、拍賣理論與機制設計領域發現了 5 項全新學術成果,並已獲領域專家獨立證實。
核心重點
證明與驗證雙向迭代
藉由將證明生成與嚴格驗證拆分為多個迭代步驟,克服單次生成難以應付複雜長程推導的缺點。
協調器調度多方向探索
協調器會將多個獨立的證明 Agent 分配到不同的推導路徑,同時探索並檢驗多種競爭性的猜想。
專業元件對抗式驗證
由多個專門的驗證組件對證明結果進行嚴格的對抗式審查,有效捕捉精細的邏輯漏洞或幻覺。
持續性的已驗證帳本
通過驗證的中間成果會被寫入持久保存的帳本中,作為後續推理的基石,確保不流失長期進度。
技術圖解
為什麼重要
傳統上,AI 在解決前沿數學與理論電腦科學未解難題上進展有限,主要是因為推理步驟太長且容易出錯。Cogentic 證明了透過精心設計的多 Agent 協調、對抗式驗證和狀態保存機制,現有的 LLM 有能力產出超越人類已知邊界、且經得起領域專家檢驗的全新數學定理。這標誌著 AI 輔助科學研究(AI for Science)邁向自動化理論創新的新里程碑。
對誰有影響
- AI 研究人員
- AI 開發者
- 學生與學習者
可以怎麼使用
- 1自動化數學定理證明與推導,探索未解的學術猜想。
- 2理論電腦科學、線上學習與博弈論(如機制設計)中的協議與算法驗證。
限制與注意事項
- 依然依賴強大的底座 LLM 提供最初的數學靈感與推導能力。
- 目前主要適用於可被結構化拆解與嚴格驗證的理論科學及數學領域。
延伸閱讀

突破生成式推薦延遲瓶頸:NVIDIA Dynamo-Triton 與 PyTorch AOTI 部署 HSTU 模型實戰
Overcoming Generative Recommender Latency: Deploying HSTU Models with NVIDIA Dynamo-Triton and PyTorch AOTI
本文介紹如何透過 NVIDIA Dynamo-Triton、PyTorch AOTI 與 FlexKV 快取技術,將高延遲的 HSTU 生成式推薦模型轉化為低延遲的生產級服務,在 Blackwell GPU 上實現最高 5.93 倍的加速。
臨床診斷 MLLM 提示詞優化:Ranking-PE 解決醫療資料極端不平衡問題
Ranking-PE: Prompt Optimization for Multimodal Clinical Diagnosis under Extreme Class Imbalance
本研究提出 Ranking-PE 框架,將多模態大模型(MLLM)的提示詞優化指標從傳統「準確度」轉向「AUROC 排序」,解決臨床醫療資料極端不平衡的問題。
排除「時間捷徑」漏洞:非侵入式腦機介面解碼技術的新突破
Fixing the "Timing Shortcut": A Breakthrough in Non-Invasive Brain-to-Text Decoding
研究揭露過去非侵入式「大腦轉文字」技術的重大進展,其實多半是模型鑽了字詞發音長度的「時間捷徑」,而非讀懂腦波。新提出的 SimpleB2T 方法透過獨立處理訊號,成功阻斷此漏洞並將解碼字錯率大幅降至 36.6%。