Holo4 登場:融合 GUI、程式碼與 API 的全能型電腦操作 AI 代理
Holo4: The Generalist Computer-Use Agent Bridging GUI, Code, and APIs

H company 推出全新 Holo4 代理模型(包含 27B 與 35B-A3B MoE)以及輕量化的 Holotron4 Nano。不同於以往僅侷限在單一介面的代理,Holo4 具備「全功能操作」能力,可在桌面、網頁、Android 與沙盒中執行螢幕點擊、代碼撰寫及 API 呼叫。在 OSWorld 2.0 及 AutomationBench 等高難度基準測試中,以極低的推理與代打成本,展現出直逼一線閉源模型的強大競爭力。
核心重點
全能多介面操作
打破 GUI 與 API 的藩籬,同一模型能同時進行螢幕點擊、編寫程式碼與調用 MCP/API,彈性適應各種複雜工作流。
專為真實業務打造
採用代理任務工廠(Agentic Task Factory)產生的 10,000 多個真實任務進行強化訓練,超越學術測試集限制。
極佳的成本效益
在 OSWorld 2.0 取得 61.7% 佳績。雖然得分略低於領先的閉源模型,但參數量極小且推理成本大幅降低。
全新架構與長效記憶
重構執行 harness,賦予代理可追蹤數百步的可靠長期記憶,並直接在桌面系統配備原生 shell 權限。
技術圖解
為什麼重要
以往的 AI 代理往往面臨「懂 GUI 的看不見 API,懂 API 的無法操作畫面」的單一介面瓶頸。Holo4 證明了全功能電腦操作代理(Generalist Computer-Use Agent)的可行性,能大幅降低企業自動化複雜工作流(如 3D 建模、軟體測試)的門檻。此外,其採用的後訓練技術能成功將輕量化模型(如 Nemotron Nano)改造為代理專家,有利於端側與私有化部署。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
- 企業決策者
可以怎麼使用
- 1自動化 CAD 3D 建模(如在 FreeCAD 中依據文字精準繪製工業零件或商標)
- 2端到端軟體開發與自主測試(如在 Godot 引擎中獨立開發、偵錯並運行完整遊戲)
- 3跨平台混合業務流程(同時操作網頁 GUI、透過 MCP 連接資料庫並呼叫內部 API)
限制與注意事項
- 在超長工作流上的表現(如 OSWorld 2.0 得分 61.7%)仍落後於頂尖閉源模型(如 Opus 5.5 的 81.8%)
- 在部分 API 基準測試(如 AutomationBench)中的私有測試集表現仍待官方進一步驗證與公佈
延伸閱讀

為什麼 Agent 的對話會騙人?微軟與 HF 推出 ThinkingBox 評測真實資料庫狀態
The Agent Said It Was Done, the Database Disagreed: Introducing ThinkingBox
傳統評測只看對話和工具呼叫,微軟與 Hugging Face 推出的 ThinkingBox 則改用「資料庫最終狀態」與「副作用」來檢驗 Agent 的真實可靠度。

AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料
AutoSynthData: Generating Targeted Training Data from Enterprise Agent Failures
AutoSynthData 是 ServiceNow 開發的框架,透過分析企業 Agent 的失敗案例與強大導師模型的成功軌跡,自動生成具備可行性、真實性與挑戰性的微調資料,顯著提升 Agent 在特定企業環境中的任務達成率。
KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸
KaliBench: Evaluating and Boosting LLM Command Generation on Kali Linux
KaliBench 是一個專為 Kali Linux 設計的細粒度指令生成基準測試。研究發現,現有開源模型在無提示下的 CLI 指令準確度皆低於 42%,但透過其獨創的「免執行期可驗證獎勵」進行強化學習,能讓 8B 微型模型達到媲美 685B MoE 模型的表現。