別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent
Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis
傳統的 LLM Agent 在處理連續任務時,常需要在 Context 中重複推理控制邏輯,耗費大量 Token。Growing Harness 顛覆此做法,從不含任何控制邏輯的「無策略鷹架」出發。在任務執行失敗時,系統利用軌跡定位問題、進行多失敗聯合修復,並以驗證閘道回滾會導致能力退化的程式碼。此過程不斷將控制邏輯累積固化為共享的程式碼框架(Harness)。實驗顯示,該方法成功讓 4B 小模型在網頁任務上達到 45% 的成功率(傳統工具調用僅 6.7%),同時減少了 76.0-91.8% 的 LLM 呼叫。
核心重點
程式碼取代脈絡推理
將重複出現的控制決策從 LLM 脈絡移出,轉化為可重複執行的程式碼,將 LLM 呼叫保留給真正需要語意理解的任務。
失敗導向的自動修復
當任務失敗時,利用執行軌跡精準定位失效的程式碼區段,並由優化器同時對多個失敗案例進行聯合修復。
防退化的驗證閘道
引入「先確保成功」的留出驗證閘道,自動回滾會損害既有任務成功率的程式碼修改,確保框架持續穩定升級。
賦能輕量級小模型
在 WebArena 測試中,4B 小模型搭配 Growing Harness 能維持約 45% 的成功率,與 120B 模型相當,而傳統工具調用方法在 4B 模型上僅有 6.7% 成功率。
技術圖解
為什麼重要
這項研究突破了 Agent 必須依賴極長 Prompt 或超大參數模型的限制。透過將控制流編譯為程式碼,不僅大幅釋放了 LLM 的 Context 空間,更降低了高達 98% 的實際推論成本。這意味著企業未來能以極低硬體門檻(如 4B 本地小模型)部署高度穩定、低延遲的專業 Agent,為邊緣運算與實用化 Agent 的普及掃清障礙。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1低成本網頁自動化操作:使用輕量級本機模型執行複雜的跨網頁、跨平台日常辦公自動化任務。
- 2特定領域 Agent 工作流優化:自動為特定的軟體工具鏈生成最優的控制與異常處理程式碼框架。
限制與注意事項
- 初始化依賴:訓練起點需要一個具備固定工具介面但無策略的基礎鷹架(Scaffold)。
- 代碼優化器上限:最終 Agent 的成效受限於背後負責生成、修復程式碼之優化器的代碼編寫能力。
延伸閱讀
突破中心化瓶頸!Agensh 框架將多 Agent 協作無縫擴展至 1,024 個智慧體
Agensh: Scaling Multi-Agent Collaboration to 1,024 Agents Without a Central Orchestrator
Agensh 是一個無中心協調器的自組織多 Agent 框架,透過共享工作空間與非同步協作循環,成功將 Agent 協作規模擴展至 1,024 個,在複雜程式設計任務中展現顯著的效能擴展性。