RECAST:透過自適應證據路由,為 LLM 計算出正確的上下文
RECAST: Active Evidence Construction via Adaptive Routing and Computation
傳統的 RAG 依賴靜態的相似度檢索,難以處理需要跨多個資料源進行篩選、聚合或計算的複雜任務。由麻省理工等機構研究團隊提出的 RECAST 框架,將證據建構視為循序決策過程。該系統由輕量化的 RouterLM 迭代選擇檢索與計算操作,並由 frozen CompilerLM 將自訂操作轉譯為可執行程式碼。一旦 RouterLM 判斷證據足夠,即交由 AnswerLM 產出解答。實驗顯示,經 GRPO 訓練的 Qwen3.5-9B 版 RECAST 表現優異,在多個基準測試中大幅超越傳統 RAG,並具備強大的零樣本泛化能力。
核心重點
主動推導證據
不只進行「被動檢索」,而是透過篩選、聚合與多步驟計算,主動構建出原本不存在於單一來源的合成證據。
三模型協作架構
RouterLM 負責循序決策,CompilerLM 將操作轉為可執行程式碼,最後由 AnswerLM 根據編譯好的證據回答問題。
基於 GRPO 的強化學習
RouterLM 透過監督式微調(SFT)與群體相對策略優化(GRPO)進行訓練,使 9B 模型能超越未經訓練的 Gemini 3.5 Flash。
優異的零樣本泛化
在未接觸過的測試基準上,RECAST 相較於最強的基底模型平均提升了 15.0%,展現極佳的跨任務適應力。
技術圖解
為什麼重要
這項研究打破了傳統 RAG 僅能「檢索既有片段」的限制,讓 AI 系統具備主動「計算與合成」證據的能力。這對於財務分析、多表數據庫查詢等需要進行複雜邏輯與數值運算的場景至關重要。此外,利用 GRPO 訓練中階模型即可超越大型商用模型,為企業部署高效率且高精準度的專屬 Agent 提供了全新路徑。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1多源財務報表與數據庫分析
- 2需要跨文件比對與數值計算的複雜問答系統
- 3自動化數據清理與多步驟程式碼生成推理
限制與注意事項
- 高度依賴程式碼執行環境,若 CompilerLM 編譯出的程式碼出錯,可能導致推理中斷或死循環。
- 多輪迭代的決策過程與程式碼編譯,相比傳統一次性 RAG 會增加系統推理延遲與運算成本。
延伸閱讀

微軟開源 Agent Lightning v1.0:僅 3,500 行程式碼,直接用生產環境 Harness 訓練 Agent 的強化學習框架
Microsoft Releases Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Real-Harness Training
微軟亞洲研究院推出 Agent Lightning v1.0,開創「Harnessed Agentic RL」架構,讓 AI Agent 訓練時能直接使用部署用的真實環境與工具套件,無須重寫程式碼即可進行高效強化學習。
打造低成本 AI 工件:LLM Agent 是否具備「能力封裝」的本領?
Agent in a Bottle: Can LLM Agents Package Their Capabilities into Cheap, Scalable Artifacts?
本研究提出 BOTTLED 基準測試,評估 LLM Agent 能否在預算限制下,自動將通用推理能力「封裝」成便宜且可擴展的特定任務小模型或程式,並揭示了零樣本能力不等於封裝能力的現狀。
利用 Web 世界模型進行對抗訓練:AdvSim2Real 提升 Web Agent 抵禦適應性提示詞注入之能力
AdvSim2Real: Co-Evolving Web Agents and Adversaries inside a Web World Model
AdvSim2Real 透過在虛擬的 Web 世界模型中協同演化任務課程、注入攻擊者與 Agent,成功在不降低一般任務完成率的前提下,大幅提升 4B 輕量級 Agent 抵禦未見過提示詞注入攻擊的能力。