Aivora
arXivAI 代理進階

TokenCast:精準預測 LLM Agent 執行過程中的 Token 消耗量

TokenCast: Accurate Token Consumption Forecasting for LLM Agents

2 分鐘閱讀
TokenCast:精準預測 LLM Agent 執行過程中的 Token 消耗量
30 秒看懂

LLM Agent 在執行相同任務時,因動態的工具回饋與不斷累積的脈絡(context),不同執行次數的 Token 消耗可能相差達一個數量級。TokenCast 為每個執行片段建立可組合的成本表示法,同時記錄自身消耗與引入的脈絡增長。隨著執行展開,它能利用新觀察到的特徵即時更新預測。在實測中,TokenCast 平均降低了 14.5% 的預測誤差,並在預算控制模擬中成功節省了 21.3% 的 Token 消耗。

核心重點

01

動態脈絡成本建模

解決 Agent 在連續呼叫中,因歷史脈絡不斷膨脹而導致每次輸入成本急遽上升的預測難題。

02

可組合的成本表示法

為各個執行片段獨立建模,記錄自身消耗與對後續步驟的脈絡影響,藉由組合相鄰片段估算累積成本。

03

即時低延遲預測

預測過程不需額外的 LLM 呼叫,在 SWE-bench Verified 上的平均預測時間僅需 32.8 毫秒。

04

顯著的預算控制成效

在預算控制模擬中,相較於固定預算策略,TokenCast 平均能省下 21.3% 的 Token 支出。

技術圖解

TokenCast 動態預測與控制流程
開始任務觀測自身與脈絡增長組合相鄰片段估算檢查預算預算充足:繼續執行任務輸入Agent 執行片段可組合成本表示即時 Token 預測預算決策與控制

為什麼重要

隨著企業大量部署基於 LLM 的 Agent(如自動化軟體開發、複雜資訊檢索),難以預估且可能無限膨脹的 API 帳單成為落地痛點。TokenCast 提供了一種極低成本、即時更新的預算防護網。開發者得以在 Agent 執行到一半、剛露出超支苗頭時就精準預測並及時止損,對於降低 AI 應用營運成本、提升財務可預測性具有關鍵的實用價值。

對誰有影響

  • AI 開發者
  • 產品經理
  • 企業決策者
  • AI 研究人員

可以怎麼使用

  1. 1企業級 Agent 預算防護罩,在執行成本預估將超出預算時,即時發出警報或安全中止。
  2. 2動態 Agent 路由與決策優化,依據即時估算的剩餘 Token 成本,動態調整 Agent 執行的精細度或策略。

限制與注意事項

  • 需要事先針對特定的 Agent 架構與任務模式進行成本表示法的學習與校準,對全新設計的 Agent 架構適應力仍待驗證。
  • 預測精確度受限於早期執行的觀測資訊,若 Agent 在執行初期的行為極度不規則,可能會降低後續預估的準確性。

延伸閱讀

以敘事狀態追蹤突破長篇小說生成:免微調的 NstAgent 框架
arXivAI 代理

以敘事狀態追蹤突破長篇小說生成:免微調的 NstAgent 框架

Scaling Long-Form Story Generation via Narrative State Tracking (NstAgent)

本研究提出免訓練的 NstAgent 框架,透過動態追蹤角色、事件與未來大綱等結構化狀態,成功將大語言模型的連貫故事生成長度大幅擴展至十萬字小說級別。

2 分鐘閱讀