CLIFT:基於共形自我驗證的網頁 Agent 訓練與測試端擴展技術
CLIFT: Conformal Self-Verification for Web Agent Training and Test-Time Scaling
訓練開源網頁 Agent 面臨兩難:二元任務成功率的獎勵過於稀疏,而使用前沿語言模型當裁判又太昂貴且無法在部署時使用。CLIFT 透過「共形自我驗證」解決此問題。在訓練時,Agent 對自身執行過程回答驗證問題,並由共形保證器篩選出與訓練裁判一致的訊號以提供步驟獎勵。在測試時,凍結此驗證庫並透過共形軌跡選擇(CTS)在多個嘗試中投票選出最佳路線,無需外部裁判即可實現測試端擴展。
核心重點
自我驗證機制
Agent 針對自身的網頁瀏覽歷程回答自然語言驗證問題,將軌跡轉化為結構化的驗證證據。
組合共形保證器
在訓練期過濾與裁判意見一致的驗證訊號,利用極性感知提升分配權重,融入每步獎勵。
免裁判測試端擴展
凍結驗證庫並利用共形軌跡選擇(CTS),透過保守多數決從多個嘗試中篩選最佳路線,完全無需呼叫外部 LLM。
強大的跨模型泛化
在 WebArena Infinity 達 SOTA;在 VisualWebArena 訓練的驗證庫能成功轉移至 GPT-5.5 測試並取得 SOTA 表現。
技術圖解
為什麼重要
傳統網頁 Agent 的強化學習極度依賴昂貴的前沿模型(如 GPT-4)進行即時評判。CLIFT 證實了「自我驗證」不僅能提供細粒度的訓練獎勵,還能在測試階段作為一個免裁判的擴展(Scaling)機制。這大幅降低了部署與運行智慧 Agent 的成本,並打通了開源模型向更強大商業模型(如 GPT-5.5)進行技術轉移的通道。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
可以怎麼使用
- 1網頁 Agent 強化學習訓練:利用細粒度的步驟獎勵,解決任務成功/失敗等稀疏獎勵難以收斂的問題。
- 2離線部署與測試端擴展:在無網路或無法呼叫外部付費 API 的環境下,對 Agent 進行多路採樣並篩選最佳執行路徑。
限制與注意事項
- 依賴初始的訓練期裁判模型來校準共形保證器,若初始裁判存在偏見,可能影響驗證庫品質。
- 測試端進行多路軌跡採樣(CTS)會增加推論時間與本地運算資源的消耗。
延伸閱讀
打造低成本 AI 工件:LLM Agent 是否具備「能力封裝」的本領?
Agent in a Bottle: Can LLM Agents Package Their Capabilities into Cheap, Scalable Artifacts?
本研究提出 BOTTLED 基準測試,評估 LLM Agent 能否在預算限制下,自動將通用推理能力「封裝」成便宜且可擴展的特定任務小模型或程式,並揭示了零樣本能力不等於封裝能力的現狀。
利用 Web 世界模型進行對抗訓練:AdvSim2Real 提升 Web Agent 抵禦適應性提示詞注入之能力
AdvSim2Real: Co-Evolving Web Agents and Adversaries inside a Web World Model
AdvSim2Real 透過在虛擬的 Web 世界模型中協同演化任務課程、注入攻擊者與 Agent,成功在不降低一般任務完成率的前提下,大幅提升 4B 輕量級 Agent 抵禦未見過提示詞注入攻擊的能力。
點陣圖秒變任意比例流程圖!「One Figure, Every Canvas」以 Agent 協同管線自動排版且支援 draw.io 編輯
One Figure, Every Canvas: Editable Flowchart Relayout via Agentic Pipeline
本研究提出一種基於 Agent 的協同管線,能將單一黑盒子的點陣流程圖自動重新排版,適應各種寬高比(如投影片、手機直式畫面等),並直接輸出成 draw.io 可編輯的 XML 格式,解決排版跑位與內容幻覺的問題。