Aivora
Hugging FaceAI 代理進階

Holo4 登場:融合 GUI、程式碼與 API 的全能型電腦操作 AI 代理

Holo4: The Generalist Computer-Use Agent Bridging GUI, Code, and APIs

2 分鐘閱讀
Holo4 登場:融合 GUI、程式碼與 API 的全能型電腦操作 AI 代理
30 秒看懂

H company 推出全新 Holo4 代理模型(包含 27B 與 35B-A3B MoE)以及輕量化的 Holotron4 Nano。不同於以往僅侷限在單一介面的代理,Holo4 具備「全功能操作」能力,可在桌面、網頁、Android 與沙盒中執行螢幕點擊、代碼撰寫及 API 呼叫。在 OSWorld 2.0 及 AutomationBench 等高難度基準測試中,以極低的推理與代打成本,展現出直逼一線閉源模型的強大競爭力。

核心重點

01

全能多介面操作

打破 GUI 與 API 的藩籬,同一模型能同時進行螢幕點擊、編寫程式碼與調用 MCP/API,彈性適應各種複雜工作流。

02

專為真實業務打造

採用代理任務工廠(Agentic Task Factory)產生的 10,000 多個真實任務進行強化訓練,超越學術測試集限制。

03

極佳的成本效益

在 OSWorld 2.0 取得 61.7% 佳績。雖然得分略低於領先的閉源模型,但參數量極小且推理成本大幅降低。

04

全新架構與長效記憶

重構執行 harness,賦予代理可追蹤數百步的可靠長期記憶,並直接在桌面系統配備原生 shell 權限。

技術圖解

Holo4 代理決策與多介面執行流程
分發點擊與輸入撰寫腳本調用工具互動執行連線狀態輸出反饋調整與重試複雜任務輸入目標作業系統與環境任務狀態驗證決策與上下文記憶核心GUI 螢幕操作沙盒程式碼執行MCP / API 呼叫

為什麼重要

以往的 AI 代理往往面臨「懂 GUI 的看不見 API,懂 API 的無法操作畫面」的單一介面瓶頸。Holo4 證明了全功能電腦操作代理(Generalist Computer-Use Agent)的可行性,能大幅降低企業自動化複雜工作流(如 3D 建模、軟體測試)的門檻。此外,其採用的後訓練技術能成功將輕量化模型(如 Nemotron Nano)改造為代理專家,有利於端側與私有化部署。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 產品經理
  • 企業決策者

可以怎麼使用

  1. 1自動化 CAD 3D 建模(如在 FreeCAD 中依據文字精準繪製工業零件或商標)
  2. 2端到端軟體開發與自主測試(如在 Godot 引擎中獨立開發、偵錯並運行完整遊戲)
  3. 3跨平台混合業務流程(同時操作網頁 GUI、透過 MCP 連接資料庫並呼叫內部 API)

限制與注意事項

  • 在超長工作流上的表現(如 OSWorld 2.0 得分 61.7%)仍落後於頂尖閉源模型(如 Opus 5.5 的 81.8%)
  • 在部分 API 基準測試(如 AutomationBench)中的私有測試集表現仍待官方進一步驗證與公佈

延伸閱讀

AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料
Hugging FaceAI 代理

AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料

AutoSynthData: Generating Targeted Training Data from Enterprise Agent Failures

AutoSynthData 是 ServiceNow 開發的框架,透過分析企業 Agent 的失敗案例與強大導師模型的成功軌跡,自動生成具備可行性、真實性與挑戰性的微調資料,顯著提升 Agent 在特定企業環境中的任務達成率。

2 分鐘閱讀
KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸
arXivAI 代理

KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸

KaliBench: Evaluating and Boosting LLM Command Generation on Kali Linux

KaliBench 是一個專為 Kali Linux 設計的細粒度指令生成基準測試。研究發現,現有開源模型在無提示下的 CLI 指令準確度皆低於 42%,但透過其獨創的「免執行期可驗證獎勵」進行強化學習,能讓 8B 微型模型達到媲美 685B MoE 模型的表現。

2 分鐘閱讀