CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術
CliffCompaction: Cost-Efficient Context Compaction for Long-Horizon Coding Agents
隨著程式碼 Agent 面臨百萬 token 的複雜任務,上下文視窗限制與高昂成本成為瓶頸。CliffCompaction 提出一種創新的自動壓縮技術:它「只刪減、不重寫」原始內容,且「絕不重複壓縮已壓縮的內容」(每次都從原始內容重新壓縮並丟棄舊壓縮)。這項技術成功降低了 50% 的成本,並在 Terminal-Bench 與 KernelBench 上達到頂尖性能,在平行測試時擴展(test-time scaling)下,以更低成本讓中階模型展現出媲美旗艦模型的實力。
核心重點
只刪減、不重寫的真實性
透過僅截斷或捨棄內容,絕不進行重寫或改寫,確保保留的上下文完全忠於原始資料,避免 LLM 在摘要時產生幻覺。
防漂移的單次壓縮機制
每一次壓縮皆直接作用於原始內容,並丟棄先前的壓縮輸出,絕不「重複壓縮已壓縮的內容」,徹底消除上下文漂移。
更高效的測試時擴展
單次 rollout 成本大幅降低,在 Terminal-Bench 上以不到兩次全上下文運行的成本,提升超過 10 個百分點的效能。
百萬級 token 持續學習
在 KernelBench 上,於 400 個步驟後實現 3.58 倍的 CUDA 核心加速,展現出超越特製搜尋演算法與專門訓練 Agent 的長任務能力。
技術圖解
| 傳統 LLM 重寫壓縮 (Traditional Rewriting) | CliffCompaction 自動壓縮 | |
|---|---|---|
| 壓縮核心手段 | 透過 LLM 重新撰寫、生成摘要 | 僅進行截斷與捨棄 (Truncate / Drop) |
| 資訊真實度 | 較低,LLM 重寫可能引入幻覺與語意扭曲 | 極高,保留內容完全與原始碼/終端機輸出一致 |
| 重複壓縮漂移 | 嚴重,不斷對「已壓縮的內容」再次壓縮造成誤差累積 | 無,每次直接操作原始內容並丟棄舊壓縮輸出 |
| 長任務持續步數 | 受限,隨步驟增加脈絡品質快速衰退 | 極佳,支援百萬 token 且在 400 步後仍持續學習 |
為什麼重要
這項研究解決了長任務 Agent 部署中的核心痛點:高昂的 token 費用與脈絡流失。透過不重寫原始資料的簡約策略,CliffCompaction 證明了「少即是多」,避免了大模型在總結時常犯的資訊扭曲。這為開發者提供了一種獨立於腳架(scaffold-agnostic)的 API 代理,讓現有開源或商業模型在處理超長程式碼專案時,能以極低代價實現高效率的測試時擴展。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1最佳化長任務程式碼編輯(如 Claude Code)在處理大型專案時的 token 消耗與脈絡精準度。
- 2加速 GPU 核心(CUDA)最佳化的持續學習任務,在數百個步驟的試錯中維持上下文完整性。
- 3實作低成本的測試時擴展(test-time scaling),以平行 rollout 讓中階模型在複雜基準測試上挑戰旗艦模型。
限制與注意事項
- 由於採用單純刪減而非語意重組,在極度需要跨段落高度資訊整合或重寫的非程式碼任務中效果可能受限。
- 目前主要在終端機與程式碼開發場景(Terminal-Bench 與 KernelBench)中進行驗證,其在通用長文字領域的適用性仍待進一步研究。
延伸閱讀
SWE-Serve:首個針對「生產級推論服務」的 AI Agent 軟體工程基準測試
SWE-Serve: Benchmarking Agentic Engineering for Production Inference Serving
SWE-Serve 是一個新型基準測試,包含來自 SGLang 的 53 個真實任務,旨在評估 AI Agent 在複雜推論伺服器架構中的程式碼實作與「生產環境正確性」。