Aivora
arXivAI 研究專業

EvoDuet:搜尋與解題協同演化的雙層優化框架,突破 LLM 科學發現的知識瓶頸

EvoDuet: Co-Evolving Web Search and Task Solving for LLM-Based Scientific Discovery

2 分鐘閱讀
EvoDuet:搜尋與解題協同演化的雙層優化框架,突破 LLM 科學發現的知識瓶頸
30 秒看懂

在利用大語言模型(LLM)進行科學發現的演化搜尋中,缺乏外部即時知識常導致探索停滯。傳統方法單純加入搜尋工具,容易隨著解答變化而重複檢索相同頁面。EvoDuet 引入了「雙層優化」機制,在不調整模型參數的前提下協同演化解答與搜尋查詢。每個迭代中,透過「檢索閘門」讓 LLM 評估知識落差,並利用內圈精煉查詢與篩選網頁文檔、外圈平行生成並評估候選解答。實驗顯示,此方法將 Gemini-3.8-Flash 的發現得分由 61.3% 提升至 82.3%,但在 Qwen3.5-9B 等小模型上則未能見效。

核心重點

01

雙層協同演化機制

內圈專注於優化與精煉搜尋查詢以篩選高價值文檔,外圈則基於這些文檔平行生成並評估任務解答,兩者同步演進。

02

主動式檢索閘門

允許 LLM 在迭代過程中主動評估自身的知識缺口,靈活決定要檢索新網頁、重用舊文檔,或直接進行解題。

03

顯著提升探索成效

在 21 項優化任務中,將 Gemini-3.8-Flash 的發現增益提升至 82.3%,並在多個複雜演算法任務中刷新最佳紀錄。

04

模型能力的門檻限制

此方法的協同演化效果高度依賴模型本身的基礎能力,如 Qwen3.5-9B 較小型的模型在此架構中並未獲得效益。

技術圖解

EvoDuet 雙層協同演化架構
啟動迭代需要外部知識直接重用/無需檢索傳遞排序後文檔生成解題候選反饋下一次迭代任務狀態與目標檢索閘門 (評估知識缺口)內圈:精煉查詢與文檔排序外圈:平行生成與解答演化評估結果並記錄

為什麼重要

複雜的科學探索任務(如演算法優化)往往需要模型未曾接觸的外部前沿知識。傳統 LLM 代理人在調用搜尋工具時,常因缺乏策略而反覆檢索無效資訊。EvoDuet 證明了「如何搜尋知識」與「如何利用知識解決問題」可以且應該被同步優化。這種無須微調模型參數的系統設計,為科學發現(AI for Science)與複雜問題求解提供了更高效、具適應性的解決方案。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 學生與學習者

可以怎麼使用

  1. 1自動化科學演算法與程式碼優化(如 Swap Reduction 等優化任務)
  2. 2需動態整合外部最新技術文檔的複雜代理人(Agent)任務導航

限制與注意事項

  • 高度依賴基底 LLM 的推理解答與自我評估能力,較小或弱性能的模型無法從此框架中受益。
  • 檢索效果受限於搜尋引擎返回的資訊品質,若初次檢索充滿雜訊,可能影響內圈的優化效率。

延伸閱讀

排除「時間捷徑」漏洞:非侵入式腦機介面解碼技術的新突破
arXivAI 研究

排除「時間捷徑」漏洞:非侵入式腦機介面解碼技術的新突破

Fixing the "Timing Shortcut": A Breakthrough in Non-Invasive Brain-to-Text Decoding

研究揭露過去非侵入式「大腦轉文字」技術的重大進展,其實多半是模型鑽了字詞發音長度的「時間捷徑」,而非讀懂腦波。新提出的 SimpleB2T 方法透過獨立處理訊號,成功阻斷此漏洞並將解碼字錯率大幅降至 36.6%。

2 分鐘閱讀