AI Daily ·
AI 代理評測與架構雙向突破,訓練效率顯著提升
Today’s AI Highlights
今日 AI 要聞聚焦於代理模型的創新評測與效率優化。Hugging Face 推出的 ThinkingBox 透過檢驗後端狀態來真實評估代理表現,同場亮相的 Holo4 則整合 GUI、代碼與 API,實現強大的電腦操作能力。此外,KV-streams 技術大幅加速強化學習訓練,而自適應循環架構 TaH2 與社交智慧框架 TACT,也同步提升了推理擴展與通訊效率。
01Hugging FaceAI 代理為什麼 Agent 的對話會騙人?微軟與 HF 推出 ThinkingBox 評測真實資料庫狀態
ThinkingBox 是一個專為 Agent 設計的沙盒評測機制,包含 507 個狀態化業務流程。研究發現,在 67.24% 的失敗案例中,Agent 表面上都順利執行完畢且無錯誤訊息,但實際檢查資料庫時卻發現了錯誤欄位或多餘副作用。藉由重複執行各任務 20 次,ThinkingBox 揭示了部分模型(如 Kimi-K3)雖有極高的解題覆蓋率,但在「每一次都做對」的穩定度上,仍大幅落後於 Claude Opus 5.5 等模型。
- 02arXivAI 研究
KV-streams:透過快取串流突破代理型強化學習的上下文壓縮瓶頸
在訓練代理型(Agentic)大型語言模型時,為管理記憶體開銷,通常會採用「上下文壓縮」技術,但這伴隨著頻繁且重複預填(prefill)的代價,嚴重拖慢訓練效率。為解決此問題,研究團隊開發了「KV-streams」。該技術不但在每次壓縮後保留並向前串流 KV 快取(而非直接清除),更能與多種壓縮策略無縫相容。實驗顯示,KV-streams 帶來了 2.6 至 5 倍的實際訓練加速。更特別的是,串流下來的 KV 快取能自發作為「循環狀態」運作,僅憑強化學習(RL)就能保留已在上下文視窗中消失的長期資訊。
- 03arXivAI 研究
自適應循環 Transformer 突破測試時縮放瓶頸:清華團隊提出 TaH2 架構
循環 Transformer 透過重複使用網路層來提高參數效率。然而,傳統方法對所有 token 進行相同次數的循環迭代,導致在相同計算量下表現反而不如非循環基準模型。為解決此痛點,研究團隊推出 TaH2。TaH2 在後訓練階段聯合訓練模型骨幹與一個「迭代決策器」,利用線上標籤評估進一步迭代是否能改善預測。在 challenging 的 AIME 數學基準測試中,TaH2 的「準確度-計算量」縮放斜率比基準模型提升了 53%,並在相同計算量下超越基準模型 3.4 個百分點。
- 04arXivAI 代理
打造精鍊社交智能:TACT 框架如何讓 AI Agent 用最少 Token 達成談判目標
在進行談判或協調時,AI Agent 往往難以兼顧「達成目標」與「簡潔溝通」。本文提出「教師輔助溝通訓練」(TACT)框架。當學生模型生成行動後,由「表達專家」去除贅字、「策略專家」提出替代方案,接著透過模擬夥伴反應來評估各方案,在「社交目標達成度」與「Token 消耗」之間取得最佳平衡。最後,以此最佳參考對話引導學生模型進行同策略蒸餾,使其在部署時能獨立進行高效且得體的社交互動。
- 05arXiv影像 AI
複製相同、蒸餾相異:為線性視覺 Transformer 注入預訓練威力的全新初始化策略
線性視覺 Transformer(Linear ViTs)雖然擁有優異的 $O(N)$ 線性複雜度,但過去缺乏有效的預訓練權重初始化方式,常需從頭訓練且效能不佳。本研究打破了過去認為「只要轉移注意力即可」的迷思,發現 Softmax 與線性注意力權重高度特定,直接複製效果極差。相對地,MLP 權重屬於算子無關,可以直接複製以保留核心特徵表示。結合「直接複製 MLP」與「蒸餾引導線性注意力路由」的 CSDD 策略,成功讓線性 ViT 追平甚至超越原有的 Softmax ViT。
06Hugging FaceAI 代理Holo4 登場:融合 GUI、程式碼與 API 的全能型電腦操作 AI 代理
H company 推出全新 Holo4 代理模型(包含 27B 與 35B-A3B MoE)以及輕量化的 Holotron4 Nano。不同於以往僅侷限在單一介面的代理,Holo4 具備「全功能操作」能力,可在桌面、網頁、Android 與沙盒中執行螢幕點擊、代碼撰寫及 API 呼叫。在 OSWorld 2.0 及 AutomationBench 等高難度基準測試中,以極低的推理與代打成本,展現出直逼一線閉源模型的強大競爭力。
- 07arXiv機器人
基於收縮動力學表徵學習的複合自適應控制框架
本文提出一種新型的表徵學習框架,用於解決動態耦合擾動下的複合自適應追蹤控制問題。研究團隊將傳統的擾動容許控制(DAC)與現代最後一層自適應擾動抑制方法相結合,透過「硬性期望最大化」(hard-EM)程序與卡爾曼平滑器,識別出具備均勻收縮特性的隱含動態擾動表徵。該方法在攜帶晃動液體與擺錘負載的打滑地面車輛,以及杜芬振盪器系統上完成了實驗驗證,展現出優於傳統 LTI 基準與 PD 控制的預測精度與追蹤性能。