AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料
AutoSynthData: Generating Targeted Training Data from Enterprise Agent Failures

通用 LLM 部署在企業特定環境中時,常因不熟悉特有工具或工作流而失敗。ServiceNow 推出 AutoSynthData,利用「目標模型失敗、導師模型成功」的落差,提煉出結構化的「能力規格卡」,藉此生成全新的任務與驗證器。每筆生成資料均通過可行性與真實性驗證,並經歷嚴格的正向與反向驗證閘門,不合格者則由 Critic 診斷修復。在 EnterpriseOps Gym 測試中,此方法成功將目標模型的任務達成率(Pass@1)提升高達 35% 以上,顯著縮小與導師模型間的差距。
核心重點
精準鎖定能力缺口
透過對比目標模型與導師模型的表現,提煉出「能力規格卡」,避免盲目生成,專門針對 Agent 痛點進行補強。
雙重驗證與自動修復
包含正向(驗證正確解法可行)與反向(確保錯誤解法會被判定失敗)驗證閘門,並透過批判者(Critic)機制即時修復瑕疵資料。
核心生成與變體擴展
先平行生成並嚴格驗證核心任務(Target),再以此為基準安全擴展出多樣化的變體(Multiply),避免產生訓練漂移。
企業實戰成效顯著
在 EnterpriseOps Gym 測試中,將 Gemma 模型的 ITSM 與 Hybrid 任務達成率分別提升了 44% 與 35%,關閉了過半的效能差距。
技術圖解
為什麼重要
企業部署 AI Agent 的最大瓶頸,在於缺乏高品質、安全且貼近實際工作流的微調資料。AutoSynthData 提供了一套工程化、可閉環運行的解決方案,將「Agent 執行失敗」轉化為「高品質訓練養分」。這套機制不僅適用於監督式微調(SFT),還能為強化學習(RL)提供動態難度對齊的自動化任務生成源,大幅降低了企業建置客製化 Agent 的開發與資料收集成本。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
- 產品經理
可以怎麼使用
- 1自動為企業內部 ITSM(IT 服務管理)系統生成符合特定流程規範與工具鏈的 Agent 微調資料。
- 2在新 API 或資料庫上線時,自動產生具備檢驗機制的 Agent 工具調用(Tool Use)練習任務與測試集。
限制與注意事項
- 高度依賴更強大的導師模型(Teacher Model)來提供正確軌跡,若導師模型在特定極端環境中也無法解決任務,則無法生成有效資料。
- 在複雜且高度動態的企業環境中,設計出完全不漏判、不誤判的正反向驗證器(Verifier)仍具有高度挑戰性。
延伸閱讀
KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸
KaliBench: Evaluating and Boosting LLM Command Generation on Kali Linux
KaliBench 是一個專為 Kali Linux 設計的細粒度指令生成基準測試。研究發現,現有開源模型在無提示下的 CLI 指令準確度皆低於 42%,但透過其獨創的「免執行期可驗證獎勵」進行強化學習,能讓 8B 微型模型達到媲美 685B MoE 模型的表現。
VISTA:為多模態 AI 打造的「長視域」互動式視覺輔助框架
VISTA: Empowering Multimodal Agents with a Long-Horizon Visual Harness
VISTA 是一個為多模態模型設計的視覺輔助框架,透過無損視覺記憶與主動檢索機制,顯著提升 AI 在複雜互動環境中的長視域推理與決策能力。

Google 發表新一代前沿模型 Gemini 4 Argon:具備 100 萬 Token 輸出與強大自主 Agent 推理能力
Google Announces Gemini 4 Argon: Frontier Model with 1M Output Tokens and Long-Horizon Reasoning
Google 發表新一代前沿模型 Gemini 4 Argon,將輸出 token 限制大幅擴充至 100 萬,專為解決軟體工程、資安防禦與企業工作流等複雜、長路徑任務而設計。