Aivora
arXivAI 代理進階

RECAST:透過自適應證據路由,為 LLM 計算出正確的上下文

RECAST: Active Evidence Construction via Adaptive Routing and Computation

2 分鐘閱讀
RECAST:透過自適應證據路由,為 LLM 計算出正確的上下文
30 秒看懂

傳統的 RAG 依賴靜態的相似度檢索,難以處理需要跨多個資料源進行篩選、聚合或計算的複雜任務。由麻省理工等機構研究團隊提出的 RECAST 框架,將證據建構視為循序決策過程。該系統由輕量化的 RouterLM 迭代選擇檢索與計算操作,並由 frozen CompilerLM 將自訂操作轉譯為可執行程式碼。一旦 RouterLM 判斷證據足夠,即交由 AnswerLM 產出解答。實驗顯示,經 GRPO 訓練的 Qwen3.5-9B 版 RECAST 表現優異,在多個基準測試中大幅超越傳統 RAG,並具備強大的零樣本泛化能力。

核心重點

01

主動推導證據

不只進行「被動檢索」,而是透過篩選、聚合與多步驟計算,主動構建出原本不存在於單一來源的合成證據。

02

三模型協作架構

RouterLM 負責循序決策,CompilerLM 將操作轉為可執行程式碼,最後由 AnswerLM 根據編譯好的證據回答問題。

03

基於 GRPO 的強化學習

RouterLM 透過監督式微調(SFT)與群體相對策略優化(GRPO)進行訓練,使 9B 模型能超越未經訓練的 Gemini 3.5 Flash。

04

優異的零樣本泛化

在未接觸過的測試基準上,RECAST 相較於最強的基底模型平均提升了 15.0%,展現極佳的跨任務適應力。

技術圖解

RECAST 系統架構與運作流程
輸入任務指定自訂操作執行程式碼回傳新證據證據足夠,傳遞上下文使用者問題與資料源AnswerLM (生成解答)CompilerLM (程式碼編譯)執行環境 (證據庫)RouterLM (循序決策)

為什麼重要

這項研究打破了傳統 RAG 僅能「檢索既有片段」的限制,讓 AI 系統具備主動「計算與合成」證據的能力。這對於財務分析、多表數據庫查詢等需要進行複雜邏輯與數值運算的場景至關重要。此外,利用 GRPO 訓練中階模型即可超越大型商用模型,為企業部署高效率且高精準度的專屬 Agent 提供了全新路徑。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1多源財務報表與數據庫分析
  2. 2需要跨文件比對與數值計算的複雜問答系統
  3. 3自動化數據清理與多步驟程式碼生成推理

限制與注意事項

  • 高度依賴程式碼執行環境,若 CompilerLM 編譯出的程式碼出錯,可能導致推理中斷或死循環。
  • 多輪迭代的決策過程與程式碼編譯,相比傳統一次性 RAG 會增加系統推理延遲與運算成本。

延伸閱讀

微軟開源 Agent Lightning v1.0:僅 3,500 行程式碼,直接用生產環境 Harness 訓練 Agent 的強化學習框架
Microsoft ResearchAI 代理

微軟開源 Agent Lightning v1.0:僅 3,500 行程式碼,直接用生產環境 Harness 訓練 Agent 的強化學習框架

Microsoft Releases Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Real-Harness Training

微軟亞洲研究院推出 Agent Lightning v1.0,開創「Harnessed Agentic RL」架構,讓 AI Agent 訓練時能直接使用部署用的真實環境與工具套件,無須重寫程式碼即可進行高效強化學習。

2 分鐘閱讀
打造低成本 AI 工件:LLM Agent 是否具備「能力封裝」的本領?
arXivAI 代理

打造低成本 AI 工件:LLM Agent 是否具備「能力封裝」的本領?

Agent in a Bottle: Can LLM Agents Package Their Capabilities into Cheap, Scalable Artifacts?

本研究提出 BOTTLED 基準測試,評估 LLM Agent 能否在預算限制下,自動將通用推理能力「封裝」成便宜且可擴展的特定任務小模型或程式,並揭示了零樣本能力不等於封裝能力的現狀。

2 分鐘閱讀