Aivora
Hugging Face開源進階

Hugging Face 推出 @huggingface/kernels:為網頁端在地 AI 提供超過 200 個極速 WebGPU 核心

Hugging Face Launches @huggingface/kernels: Over 200 Optimized WebGPU Kernels for Local Web AI

2 分鐘閱讀
Hugging Face 推出 @huggingface/kernels:為網頁端在地 AI 提供超過 200 個極速 WebGPU 核心
30 秒看懂

Hugging Face 推出全新開源 JavaScript 載入器 @huggingface/kernels,可直接從 Hub 下載並執行 207 個針對網頁端優化的 WebGPU 算子(如 MatMul、Softmax 等)。此外,官方同步推出瀏覽器效能測試套件 Fleet,讓社群能夠在不同硬體上進行基準測試並回報正確性。效能實測顯示,這套核心在 Apple M4 GPU 上相較於 ORT Web 實現了 2.57 倍的幾何平均加速,為瀏覽器端在地化 AI 推論打下高效能的基礎。

核心重點

01

207 個開源 WebGPU 核心

採用 Apache-2.0 授權,涵蓋矩陣乘法、Softmax、層歸一化等機器學習常用算子。

02

版本化與結構化合約

透過 @huggingface/kernels 載入器,開發者可直接呼叫包含測試、基準與 WGSL 範本的完整核心包。

03

Fleet 瀏覽器基準測試

透過瀏覽器端測試套件眾包收集真實硬體效能與正確性資料,優化不同硬體上的算子變體。

04

顯著的效能提升

在 Apple M4 GPU 測試中,相較於 ONNX Runtime Web 達到 2.57 倍的幾何平均加速,特定極端案例甚至快上萬倍。

技術圖解

@huggingface/kernels 與 ORT WebGPU 於 Apple M4 GPU 之效能對比
@huggingface/kernelsORT WebGPUSpeedup (加速比)
Add (加法)0.064 ms0.227 ms3.52x
MatMul (矩陣乘法)0.115 ms0.131 ms1.14x
Softmax0.114 ms0.240 ms2.11x
LayerNormalization (層歸一化)0.061 ms0.135 ms2.22x

為什麼重要

這項釋出為瀏覽器端 AI(WebAI)生態系提供了解耦且高效能的底層積木。傳統上,WebGPU 效能會因不同 GPU 和瀏覽器架構而大打折扣。藉由將算子獨立打包、版本化,並結合眾包測試,開發者能更輕易地在網頁端部署高效能的在地模型(Local AI),不需依賴龐大且難以針對特定硬體微調的單一推論引擎。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1網頁端在地 AI 推論:利用最佳化的 WebGPU 算子,在網頁瀏覽器內直接部署並執行輕量且快速的機器學習模型。
  2. 2自訂 WebGPU 執行期開發:以結構化的核心儲存庫作為參考實作,開發客製化的 WebGPU 執行期(Runtime)。
  3. 3眾包硬體效能剖析:整合 Fleet 測試套件,評估真實使用者端 GPU 的效能並偵測特定硬體的相容性問題。

限制與注意事項

  • 瀏覽器與硬體相容性限制:執行這些核心需要支援 WebGPU 的瀏覽器,其可用性取決於作業系統、顯示卡及驅動程式。
  • 未包含初始化開銷:效能數據僅測量 GPU 運算時間,未計入載入核心、編譯著色器(Shader)及記憶體傳輸等初始化成本。
  • 目前僅限單一算子:此專案目前提供獨立的核心算子,尚未整合為完整的端到端模型推論流水線。