Aivora
Hugging FaceAI 代理進階

AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料

AutoSynthData: Generating Targeted Training Data from Enterprise Agent Failures

2 分鐘閱讀
AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料
30 秒看懂

通用 LLM 部署在企業特定環境中時,常因不熟悉特有工具或工作流而失敗。ServiceNow 推出 AutoSynthData,利用「目標模型失敗、導師模型成功」的落差,提煉出結構化的「能力規格卡」,藉此生成全新的任務與驗證器。每筆生成資料均通過可行性與真實性驗證,並經歷嚴格的正向與反向驗證閘門,不合格者則由 Critic 診斷修復。在 EnterpriseOps Gym 測試中,此方法成功將目標模型的任務達成率(Pass@1)提升高達 35% 以上,顯著縮小與導師模型間的差距。

核心重點

01

精準鎖定能力缺口

透過對比目標模型與導師模型的表現,提煉出「能力規格卡」,避免盲目生成,專門針對 Agent 痛點進行補強。

02

雙重驗證與自動修復

包含正向(驗證正確解法可行)與反向(確保錯誤解法會被判定失敗)驗證閘門,並透過批判者(Critic)機制即時修復瑕疵資料。

03

核心生成與變體擴展

先平行生成並嚴格驗證核心任務(Target),再以此為基準安全擴展出多樣化的變體(Multiply),避免產生訓練漂移。

04

企業實戰成效顯著

在 EnterpriseOps Gym 測試中,將 Gemma 模型的 ITSM 與 Hybrid 任務達成率分別提升了 44% 與 35%,關閉了過半的效能差距。

技術圖解

AutoSynthData 生成與驗證工作流
分析失敗指引生成提交候選通過失敗通過失敗修復重試評估能力缺口提煉能力卡生成新任務反向驗證門診斷與修復訓練資料集正向驗證門

為什麼重要

企業部署 AI Agent 的最大瓶頸,在於缺乏高品質、安全且貼近實際工作流的微調資料。AutoSynthData 提供了一套工程化、可閉環運行的解決方案,將「Agent 執行失敗」轉化為「高品質訓練養分」。這套機制不僅適用於監督式微調(SFT),還能為強化學習(RL)提供動態難度對齊的自動化任務生成源,大幅降低了企業建置客製化 Agent 的開發與資料收集成本。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者
  • 產品經理

可以怎麼使用

  1. 1自動為企業內部 ITSM(IT 服務管理)系統生成符合特定流程規範與工具鏈的 Agent 微調資料。
  2. 2在新 API 或資料庫上線時,自動產生具備檢驗機制的 Agent 工具調用(Tool Use)練習任務與測試集。

限制與注意事項

  • 高度依賴更強大的導師模型(Teacher Model)來提供正確軌跡,若導師模型在特定極端環境中也無法解決任務,則無法生成有效資料。
  • 在複雜且高度動態的企業環境中,設計出完全不漏判、不誤判的正反向驗證器(Verifier)仍具有高度挑戰性。

延伸閱讀

KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸
arXivAI 代理

KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸

KaliBench: Evaluating and Boosting LLM Command Generation on Kali Linux

KaliBench 是一個專為 Kali Linux 設計的細粒度指令生成基準測試。研究發現,現有開源模型在無提示下的 CLI 指令準確度皆低於 42%,但透過其獨創的「免執行期可驗證獎勵」進行強化學習,能讓 8B 微型模型達到媲美 685B MoE 模型的表現。

2 分鐘閱讀