Aivora
NVIDIA DeveloperAI 代理進階

使用 NVIDIA NeMo Relay 追蹤 AI Agent 的執行軌跡與效能

Tracing AI Agent Trajectories and Performance with NVIDIA NeMo Relay

2 分鐘閱讀
使用 NVIDIA NeMo Relay 追蹤 AI Agent 的執行軌跡與效能
30 秒看懂

傳統的 Agent 評估僅看最終結果是否成功,卻忽略了過程中可能存在的無效重複搜尋或多餘的模型調用。NVIDIA NeMo Relay 為此提供了結構化的觀測能力。它原生整合於 Hermes Agent,能輸出 ATOF 軌跡事件日誌與 ATIF 互動步驟紀錄,並支援以 OpenTelemetry 格式將追蹤資料匯出至 Arize Phoenix 等工具。藉由這套工具,開發者能更精準地分析 Agent 在執行任務時的 Token 消耗、工具調用錯誤以及重試歷程,從而進行系統性的效能優化。

核心重點

01

揭示隱藏的低效路徑

即使 Agent 最終給出正確答案,中間仍可能包含重試、重複讀取檔案等耗費 Token 且增加延遲的低效行為。

02

ATOF 與 ATIF 雙重格式

ATOF 負責記錄生命週期事件的層級與關聯;ATIF 則將其整合為便於分析的步驟軌跡。

03

支援標準 OpenTelemetry

透過 OpenInference 匯出器,可將追蹤資料無縫傳送至 Arize Phoenix 或 LangSmith 等視覺化分析平台。

04

系統化評估 Harness 變更

藉由對比基準線與修改後的多次測試,開發者能釐清效能提升是源於最佳化,還是單純因為模型放棄了部分重試。

技術圖解

NeMo Relay 支援的三種觀測資料格式對比
ATOFATIFOpenTelemetry
格式與結構JSONL 串流日誌JSON 步驟紀錄Parent-Child Spans 結構
核心內容生命週期事件與 UUID 關聯彙整後的工具調用與觀察Token、延遲、錯誤屬性指標
適用場景除錯個別事件與時間排序逐步分析評估 Agent 解決路徑在 Phoenix 等工具中視覺化分析

為什麼重要

在企業級 AI 應用中,Agent 的運作成本與穩定性至關重要。僅憑「任務是否完成」無法作為優化系統的可靠依據。NeMo Relay 提供的結構化軌跡數據,不僅能作為安全防護與政策審查的證據層,還能讓開發者在調整提示詞或工具時,擁有量化的數據支持,避免落入「解決了當前問題卻導致整體運行更慢、更貴」的盲區。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1偵測並修復 Agent 在執行終端機或檔案系統指令時產生的無限重試迴圈。
  2. 2比較不同模型在執行複雜研究任務時的 Token 消耗、工具調用次數與實際執行時長。

限制與注意事項

  • 追蹤軌跡可能包含敏感的使用者提示詞、模型回應及系統檔案路徑,在共享或導出前需進行安全審查。
  • 評估 Harness 變更時,必須嚴格限制變數(如固定搜尋結果、API 金鑰和執行上限),否則隨機的外部網路反應會使測試結果失效。

延伸閱讀

AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料
Hugging FaceAI 代理

AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料

AutoSynthData: Generating Targeted Training Data from Enterprise Agent Failures

AutoSynthData 是 ServiceNow 開發的框架,透過分析企業 Agent 的失敗案例與強大導師模型的成功軌跡,自動生成具備可行性、真實性與挑戰性的微調資料,顯著提升 Agent 在特定企業環境中的任務達成率。

2 分鐘閱讀
KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸
arXivAI 代理

KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸

KaliBench: Evaluating and Boosting LLM Command Generation on Kali Linux

KaliBench 是一個專為 Kali Linux 設計的細粒度指令生成基準測試。研究發現,現有開源模型在無提示下的 CLI 指令準確度皆低於 42%,但透過其獨創的「免執行期可驗證獎勵」進行強化學習,能讓 8B 微型模型達到媲美 685B MoE 模型的表現。

2 分鐘閱讀