Aivora
arXivAI 程式開發專業

SWE-Serve:首個針對「生產級推論服務」的 AI Agent 軟體工程基準測試

SWE-Serve: Benchmarking Agentic Engineering for Production Inference Serving

2 分鐘閱讀
SWE-Serve:首個針對「生產級推論服務」的 AI Agent 軟體工程基準測試
30 秒看懂

現有的軟體工程基準測試鮮少關注推論服務(Inference Serving)的複雜需求。SWE-Serve 填補了這一空白,基於熱門開源框架 SGLang 的真實變更,設計了 53 個涵蓋模型支援、執行期與 API 等面向的系統級任務。測試結果顯示,雖然最強的模型配置能達到 75% 的平均 pass@1,但在面對端到端(E2E)生產級測試時,有近三分之一在本地通過功能測試的提交會被拒絕。這揭示了本地碼農工作與真正達到生產環境正確性之間的巨大鴻溝。

核心重點

01

填補推論工程空白

以往的基準測試多關注於單一算子優化或通用程式碼編寫,而 SWE-Serve 專注於整套推論服務棧(Serving Stack)的儲存庫級工程。

02

基於真實專案 SGLang

包含 53 個源自 SGLang 真實生產環境變更的任務,涵蓋 6 大推論工程類別,可在 CPU 或單張 H100 GPU 上執行。

03

量化生產環境正確性差距

在 19 個端到端測試任務中,有約三分之一能通過局部測試的程式碼,在 E2E 測試中被拒絕(通過率從 69.4% 降至 45.9%)。

04

嚴格且多維的驗證機制

引入隱藏功能與迴歸測試、校準效能門檻(Performance Gates)以及對抗性驗證器,確保評估的完整性。

技術圖解

傳統軟體工程基準測試 vs. SWE-Serve
傳統基準測試 (Traditional Benchmarks)SWE-Serve
測試範疇通用程式碼修復 / 單一演算法任務推論服務棧(模型支援、執行期、API)
測試層級單元測試與局部功能測試隱藏測試、E2E 服務測試與校準效能門檻
任務來源多個不同開源專案的歷史問題SGLang 生產環境中的實際變更
生產正確性考量未明確區分本地與生產環境差異量化端到端測試對程式碼的拒絕率 (約 1/3 遭拒)

為什麼重要

隨著 AI Agent 開始參與複雜的系統工程,僅在本地執行成功已不足夠。SWE-Serve 首次將「生產環境正確性」量化,迫使 Agent 不僅要會寫程式,還要理解推論服務在模型、執行期、API 之間協同運作的系統級影響。這有助於推動更具實用價值、能直接部署程式碼的 AI 工程師發展。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理

可以怎麼使用

  1. 1評估 AI 程式碼 Agent 在高併發、高效能系統(如推論引擎)中的工程能力。
  2. 2開發和驗證適用於推論框架(如 SGLang)的整合測試與迴歸測試自動化流程。

限制與注意事項

  • 任務目前完全基於 SGLang 單一專案,可能無法完全代表其他推論引擎的架構差異。
  • 部分測試任務需要高效能的 H100 GPU,這可能會增加部分研究團隊運行評估的硬體門檻。

延伸閱讀

CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術
arXivAI 程式開發

CliffCompaction:長任務程式碼 Agent 的高效能 context 自動壓縮技術

CliffCompaction: Cost-Efficient Context Compaction for Long-Horizon Coding Agents

CliffCompaction 是一種專為長任務程式碼 Agent 設計的自動壓縮技術,透過「僅刪減、不重寫」的策略與單次壓縮機制,在降低高達 50% token 成本的同時,顯著提升長對話與測試時擴展的效率。

2 分鐘閱讀