EvoDuet:搜尋與解題協同演化的雙層優化框架,突破 LLM 科學發現的知識瓶頸
EvoDuet: Co-Evolving Web Search and Task Solving for LLM-Based Scientific Discovery
在利用大語言模型(LLM)進行科學發現的演化搜尋中,缺乏外部即時知識常導致探索停滯。傳統方法單純加入搜尋工具,容易隨著解答變化而重複檢索相同頁面。EvoDuet 引入了「雙層優化」機制,在不調整模型參數的前提下協同演化解答與搜尋查詢。每個迭代中,透過「檢索閘門」讓 LLM 評估知識落差,並利用內圈精煉查詢與篩選網頁文檔、外圈平行生成並評估候選解答。實驗顯示,此方法將 Gemini-3.8-Flash 的發現得分由 61.3% 提升至 82.3%,但在 Qwen3.5-9B 等小模型上則未能見效。
核心重點
雙層協同演化機制
內圈專注於優化與精煉搜尋查詢以篩選高價值文檔,外圈則基於這些文檔平行生成並評估任務解答,兩者同步演進。
主動式檢索閘門
允許 LLM 在迭代過程中主動評估自身的知識缺口,靈活決定要檢索新網頁、重用舊文檔,或直接進行解題。
顯著提升探索成效
在 21 項優化任務中,將 Gemini-3.8-Flash 的發現增益提升至 82.3%,並在多個複雜演算法任務中刷新最佳紀錄。
模型能力的門檻限制
此方法的協同演化效果高度依賴模型本身的基礎能力,如 Qwen3.5-9B 較小型的模型在此架構中並未獲得效益。
技術圖解
為什麼重要
複雜的科學探索任務(如演算法優化)往往需要模型未曾接觸的外部前沿知識。傳統 LLM 代理人在調用搜尋工具時,常因缺乏策略而反覆檢索無效資訊。EvoDuet 證明了「如何搜尋知識」與「如何利用知識解決問題」可以且應該被同步優化。這種無須微調模型參數的系統設計,為科學發現(AI for Science)與複雜問題求解提供了更高效、具適應性的解決方案。
對誰有影響
- AI 研究人員
- AI 開發者
- 學生與學習者
可以怎麼使用
- 1自動化科學演算法與程式碼優化(如 Swap Reduction 等優化任務)
- 2需動態整合外部最新技術文檔的複雜代理人(Agent)任務導航
限制與注意事項
- 高度依賴基底 LLM 的推理解答與自我評估能力,較小或弱性能的模型無法從此框架中受益。
- 檢索效果受限於搜尋引擎返回的資訊品質,若初次檢索充滿雜訊,可能影響內圈的優化效率。
延伸閱讀

突破生成式推薦延遲瓶頸:NVIDIA Dynamo-Triton 與 PyTorch AOTI 部署 HSTU 模型實戰
Overcoming Generative Recommender Latency: Deploying HSTU Models with NVIDIA Dynamo-Triton and PyTorch AOTI
本文介紹如何透過 NVIDIA Dynamo-Triton、PyTorch AOTI 與 FlexKV 快取技術,將高延遲的 HSTU 生成式推薦模型轉化為低延遲的生產級服務,在 Blackwell GPU 上實現最高 5.93 倍的加速。
臨床診斷 MLLM 提示詞優化:Ranking-PE 解決醫療資料極端不平衡問題
Ranking-PE: Prompt Optimization for Multimodal Clinical Diagnosis under Extreme Class Imbalance
本研究提出 Ranking-PE 框架,將多模態大模型(MLLM)的提示詞優化指標從傳統「準確度」轉向「AUROC 排序」,解決臨床醫療資料極端不平衡的問題。
排除「時間捷徑」漏洞:非侵入式腦機介面解碼技術的新突破
Fixing the "Timing Shortcut": A Breakthrough in Non-Invasive Brain-to-Text Decoding
研究揭露過去非侵入式「大腦轉文字」技術的重大進展,其實多半是模型鑽了字詞發音長度的「時間捷徑」,而非讀懂腦波。新提出的 SimpleB2T 方法透過獨立處理訊號,成功阻斷此漏洞並將解碼字錯率大幅降至 36.6%。