TokenCast:精準預測 LLM Agent 執行過程中的 Token 消耗量
TokenCast: Accurate Token Consumption Forecasting for LLM Agents
LLM Agent 在執行相同任務時,因動態的工具回饋與不斷累積的脈絡(context),不同執行次數的 Token 消耗可能相差達一個數量級。TokenCast 為每個執行片段建立可組合的成本表示法,同時記錄自身消耗與引入的脈絡增長。隨著執行展開,它能利用新觀察到的特徵即時更新預測。在實測中,TokenCast 平均降低了 14.5% 的預測誤差,並在預算控制模擬中成功節省了 21.3% 的 Token 消耗。
核心重點
動態脈絡成本建模
解決 Agent 在連續呼叫中,因歷史脈絡不斷膨脹而導致每次輸入成本急遽上升的預測難題。
可組合的成本表示法
為各個執行片段獨立建模,記錄自身消耗與對後續步驟的脈絡影響,藉由組合相鄰片段估算累積成本。
即時低延遲預測
預測過程不需額外的 LLM 呼叫,在 SWE-bench Verified 上的平均預測時間僅需 32.8 毫秒。
顯著的預算控制成效
在預算控制模擬中,相較於固定預算策略,TokenCast 平均能省下 21.3% 的 Token 支出。
技術圖解
為什麼重要
隨著企業大量部署基於 LLM 的 Agent(如自動化軟體開發、複雜資訊檢索),難以預估且可能無限膨脹的 API 帳單成為落地痛點。TokenCast 提供了一種極低成本、即時更新的預算防護網。開發者得以在 Agent 執行到一半、剛露出超支苗頭時就精準預測並及時止損,對於降低 AI 應用營運成本、提升財務可預測性具有關鍵的實用價值。
對誰有影響
- AI 開發者
- 產品經理
- 企業決策者
- AI 研究人員
可以怎麼使用
- 1企業級 Agent 預算防護罩,在執行成本預估將超出預算時,即時發出警報或安全中止。
- 2動態 Agent 路由與決策優化,依據即時估算的剩餘 Token 成本,動態調整 Agent 執行的精細度或策略。
限制與注意事項
- 需要事先針對特定的 Agent 架構與任務模式進行成本表示法的學習與校準,對全新設計的 Agent 架構適應力仍待驗證。
- 預測精確度受限於早期執行的觀測資訊,若 Agent 在執行初期的行為極度不規則,可能會降低後續預估的準確性。
延伸閱讀
以敘事狀態追蹤突破長篇小說生成:免微調的 NstAgent 框架
Scaling Long-Form Story Generation via Narrative State Tracking (NstAgent)
本研究提出免訓練的 NstAgent 框架,透過動態追蹤角色、事件與未來大綱等結構化狀態,成功將大語言模型的連貫故事生成長度大幅擴展至十萬字小說級別。
DeepEdu-v1:突破硬體與法規限制,專為越南教育量身打造的在地化 AI 代理模型
DeepEdu-v1: Efficient and Scalable Agentic LLMs for Vietnamese Education
針對越南教育法規與地端硬體限制,DeepEdu-v1 透過 SCALE 框架優化長文本推論並建立自適應代理機制,在保護學生隱私的同時實現低延遲與高精準度的在地化教學。

Google DeepMind 發表 Gemini 3.8 Live with Live Avatar:具備即時視覺化身與背景任務處理能力的企業級 AI 代理
Google DeepMind Introduces Gemini 3.8 Live with Live Avatar: Real-Time Visual AI Agents for Enterprise
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,結合即時影片與語音生成,打造出支援 97 種語言並具備背景工具執行能力的動態虛擬化身。