Aivora
arXivAI 代理專業

別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent

Grow the Harness, Not the Context: Building Low-Cost Specialist Agents via Failure-Guided Code Synthesis

2 分鐘閱讀
別撐大脈絡,改建構程式框架:Growing Harness 透過「失敗導向學習」自動生成高效能 Agent
30 秒看懂

傳統的 LLM Agent 在處理連續任務時,常需要在 Context 中重複推理控制邏輯,耗費大量 Token。Growing Harness 顛覆此做法,從不含任何控制邏輯的「無策略鷹架」出發。在任務執行失敗時,系統利用軌跡定位問題、進行多失敗聯合修復,並以驗證閘道回滾會導致能力退化的程式碼。此過程不斷將控制邏輯累積固化為共享的程式碼框架(Harness)。實驗顯示,該方法成功讓 4B 小模型在網頁任務上達到 45% 的成功率(傳統工具調用僅 6.7%),同時減少了 76.0-91.8% 的 LLM 呼叫。

核心重點

01

程式碼取代脈絡推理

將重複出現的控制決策從 LLM 脈絡移出,轉化為可重複執行的程式碼,將 LLM 呼叫保留給真正需要語意理解的任務。

02

失敗導向的自動修復

當任務失敗時,利用執行軌跡精準定位失效的程式碼區段,並由優化器同時對多個失敗案例進行聯合修復。

03

防退化的驗證閘道

引入「先確保成功」的留出驗證閘道,自動回滾會損害既有任務成功率的程式碼修改,確保框架持續穩定升級。

04

賦能輕量級小模型

在 WebArena 測試中,4B 小模型搭配 Growing Harness 能維持約 45% 的成功率,與 120B 模型相當,而傳統工具調用方法在 4B 模型上僅有 6.7% 成功率。

技術圖解

Growing Harness 失敗導向程式學習流程
初始化任務失敗時傳遞失效區間生成變更驗證成功:累積驗證失敗:回滾更新後的框架無策略鷹架 (無控制邏輯)失敗軌跡定位程式碼 聯合修復器防退化 驗證閘道任務執行 與軌跡記錄持續成長的 共享程式框架

為什麼重要

這項研究突破了 Agent 必須依賴極長 Prompt 或超大參數模型的限制。透過將控制流編譯為程式碼,不僅大幅釋放了 LLM 的 Context 空間,更降低了高達 98% 的實際推論成本。這意味著企業未來能以極低硬體門檻(如 4B 本地小模型)部署高度穩定、低延遲的專業 Agent,為邊緣運算與實用化 Agent 的普及掃清障礙。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1低成本網頁自動化操作:使用輕量級本機模型執行複雜的跨網頁、跨平台日常辦公自動化任務。
  2. 2特定領域 Agent 工作流優化:自動為特定的軟體工具鏈生成最優的控制與異常處理程式碼框架。

限制與注意事項

  • 初始化依賴:訓練起點需要一個具備固定工具介面但無策略的基礎鷹架(Scaffold)。
  • 代碼優化器上限:最終 Agent 的成效受限於背後負責生成、修復程式碼之優化器的代碼編寫能力。

延伸閱讀