Aivora
arXivAI 代理進階

以「後設技能」為核心的 AI4AI:為 Agent 設計最佳執行環境的測試期學習架構

Learning Meta-Skills for Agent Harness Design in Test-Time AI4AI

2 分鐘閱讀
以「後設技能」為核心的 AI4AI:為 Agent 設計最佳執行環境的測試期學習架構
30 秒看懂

傳統提升 Agent 表現多聚焦於增強其推理能力,本論文則從「環境建構」下手。在模型權重凍結的情況下,設計一個「建造者(Builder)」模型來為「目標(Target)」Agent 建構執行環境。研究引入「後設技能(Meta-Skill)」機制,讓建造者從目標 Agent 的執行回饋中總結出環境設計原則(何時提供支援、提供何種資源)。在 Harness-Bench 和 NewtonBench 測試中,此方法比無技能建構提升了 8.95%,且比直接將技能庫交給 Target 還要高出 12.02%。

核心重點

01

AI4AI 環境建構

探討在不更動模型權重的前提下,由 Builder 模型為 Target Agent 動態建構最佳的執行環境。

02

創新的後設技能

將經驗轉化為「何時需要支援、提供什麼資源」的具體規則,使建造經驗能在未知任務中重複使用。

03

顯著的效能增長

相較於無技能建構提升 8.95 個百分點,相較於直接將技能庫交給目標 Agent 提升 12.02 個百分點。

04

無權重自我進化

當 Builder 與 Target 為同一個模型時依然有效,開闢了一條無需微調即可實現系統級自我提升的新途徑。

技術圖解

測試期 AI-for-AI 與後設技能學習工作流
指引建構部署資源輔助執行產生結果更新與優化後設技能庫建造者模型執行環境目標 Agent執行回饋

為什麼重要

傳統的 AI 自我提升往往需要耗費大量資源進行模型微調。這項研究證明了「不改動模型權重,光是優化執行環境(Harness)」就能大幅提升 Agent 的任務達成率。這為開發更安全、靈活且低成本的複合式 AI 系統(Compound AI Systems)提供了一個全新方向:讓 AI 學習如何成為更稱職的「環境建造者」,為其他 AI 準備量身打造的執行環境。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1測試期環境優化
  2. 2無需微調的自我進化系統

限制與注意事項

  • 高度依賴開發階段的回饋資訊,若開發集與測試集任務差距過大,後設技能的效益可能受限。
  • 引入 Builder 模型進行二階段環境建構,會帶來額外的推論延遲與 API 呼叫成本。

延伸閱讀

TokenCast:精準預測 LLM Agent 執行過程中的 Token 消耗量
arXivAI 代理

TokenCast:精準預測 LLM Agent 執行過程中的 Token 消耗量

TokenCast: Accurate Token Consumption Forecasting for LLM Agents

本研究提出 TokenCast 預測方法,透過可組合的成本表示法,在不增加 LLM 呼叫的前提下,以平均 32.8 毫秒的超低延遲,即時且精準地預測 Agent 執行時的動態 Token 消耗。

2 分鐘閱讀
以敘事狀態追蹤突破長篇小說生成:免微調的 NstAgent 框架
arXivAI 代理

以敘事狀態追蹤突破長篇小說生成:免微調的 NstAgent 框架

Scaling Long-Form Story Generation via Narrative State Tracking (NstAgent)

本研究提出免訓練的 NstAgent 框架,透過動態追蹤角色、事件與未來大綱等結構化狀態,成功將大語言模型的連貫故事生成長度大幅擴展至十萬字小說級別。

2 分鐘閱讀