Aivora
arXivAI 代理專業

CLIFT:基於共形自我驗證的網頁 Agent 訓練與測試端擴展技術

CLIFT: Conformal Self-Verification for Web Agent Training and Test-Time Scaling

2 分鐘閱讀
CLIFT:基於共形自我驗證的網頁 Agent 訓練與測試端擴展技術
30 秒看懂

訓練開源網頁 Agent 面臨兩難:二元任務成功率的獎勵過於稀疏,而使用前沿語言模型當裁判又太昂貴且無法在部署時使用。CLIFT 透過「共形自我驗證」解決此問題。在訓練時,Agent 對自身執行過程回答驗證問題,並由共形保證器篩選出與訓練裁判一致的訊號以提供步驟獎勵。在測試時,凍結此驗證庫並透過共形軌跡選擇(CTS)在多個嘗試中投票選出最佳路線,無需外部裁判即可實現測試端擴展。

核心重點

01

自我驗證機制

Agent 針對自身的網頁瀏覽歷程回答自然語言驗證問題,將軌跡轉化為結構化的驗證證據。

02

組合共形保證器

在訓練期過濾與裁判意見一致的驗證訊號,利用極性感知提升分配權重,融入每步獎勵。

03

免裁判測試端擴展

凍結驗證庫並利用共形軌跡選擇(CTS),透過保守多數決從多個嘗試中篩選最佳路線,完全無需呼叫外部 LLM。

04

強大的跨模型泛化

在 WebArena Infinity 達 SOTA;在 VisualWebArena 訓練的驗證庫能成功轉移至 GPT-5.5 測試並取得 SOTA 表現。

技術圖解

CLIFT 雙階段架構:訓練與測試端擴展
產生問答軌跡訓練階段分配權重與獎勵測試階段 (凍結驗證庫)多數決篩選Agent 網頁瀏覽軌跡自我驗證問答共形保證器 (校準)共形軌跡選擇 (CTS)步驟級強化學習獎勵最終最佳執行路徑

為什麼重要

傳統網頁 Agent 的強化學習極度依賴昂貴的前沿模型(如 GPT-4)進行即時評判。CLIFT 證實了「自我驗證」不僅能提供細粒度的訓練獎勵,還能在測試階段作為一個免裁判的擴展(Scaling)機制。這大幅降低了部署與運行智慧 Agent 的成本,並打通了開源模型向更強大商業模型(如 GPT-5.5)進行技術轉移的通道。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1網頁 Agent 強化學習訓練:利用細粒度的步驟獎勵,解決任務成功/失敗等稀疏獎勵難以收斂的問題。
  2. 2離線部署與測試端擴展:在無網路或無法呼叫外部付費 API 的環境下,對 Agent 進行多路採樣並篩選最佳執行路徑。

限制與注意事項

  • 依賴初始的訓練期裁判模型來校準共形保證器,若初始裁判存在偏見,可能影響驗證庫品質。
  • 測試端進行多路軌跡採樣(CTS)會增加推論時間與本地運算資源的消耗。

延伸閱讀

打造低成本 AI 工件:LLM Agent 是否具備「能力封裝」的本領?
arXivAI 代理

打造低成本 AI 工件:LLM Agent 是否具備「能力封裝」的本領?

Agent in a Bottle: Can LLM Agents Package Their Capabilities into Cheap, Scalable Artifacts?

本研究提出 BOTTLED 基準測試,評估 LLM Agent 能否在預算限制下,自動將通用推理能力「封裝」成便宜且可擴展的特定任務小模型或程式,並揭示了零樣本能力不等於封裝能力的現狀。

2 分鐘閱讀
點陣圖秒變任意比例流程圖!「One Figure, Every Canvas」以 Agent 協同管線自動排版且支援 draw.io 編輯
arXivAI 代理

點陣圖秒變任意比例流程圖!「One Figure, Every Canvas」以 Agent 協同管線自動排版且支援 draw.io 編輯

One Figure, Every Canvas: Editable Flowchart Relayout via Agentic Pipeline

本研究提出一種基於 Agent 的協同管線,能將單一黑盒子的點陣流程圖自動重新排版,適應各種寬高比(如投影片、手機直式畫面等),並直接輸出成 draw.io 可編輯的 XML 格式,解決排版跑位與內容幻覺的問題。

2 分鐘閱讀