Hugging Face開源進階
Hugging Face 推出 @huggingface/kernels:為網頁端在地 AI 提供超過 200 個極速 WebGPU 核心
Hugging Face Launches @huggingface/kernels: Over 200 Optimized WebGPU Kernels for Local Web AI
30 秒看懂
Hugging Face 推出全新開源 JavaScript 載入器 @huggingface/kernels,可直接從 Hub 下載並執行 207 個針對網頁端優化的 WebGPU 算子(如 MatMul、Softmax 等)。此外,官方同步推出瀏覽器效能測試套件 Fleet,讓社群能夠在不同硬體上進行基準測試並回報正確性。效能實測顯示,這套核心在 Apple M4 GPU 上相較於 ORT Web 實現了 2.57 倍的幾何平均加速,為瀏覽器端在地化 AI 推論打下高效能的基礎。
核心重點
01
207 個開源 WebGPU 核心
採用 Apache-2.0 授權,涵蓋矩陣乘法、Softmax、層歸一化等機器學習常用算子。
02
版本化與結構化合約
透過 @huggingface/kernels 載入器,開發者可直接呼叫包含測試、基準與 WGSL 範本的完整核心包。
03
Fleet 瀏覽器基準測試
透過瀏覽器端測試套件眾包收集真實硬體效能與正確性資料,優化不同硬體上的算子變體。
04
顯著的效能提升
在 Apple M4 GPU 測試中,相較於 ONNX Runtime Web 達到 2.57 倍的幾何平均加速,特定極端案例甚至快上萬倍。
技術圖解
@huggingface/kernels 與 ORT WebGPU 於 Apple M4 GPU 之效能對比
| @huggingface/kernels | ORT WebGPU | Speedup (加速比) | |
|---|---|---|---|
| Add (加法) | 0.064 ms | 0.227 ms | 3.52x |
| MatMul (矩陣乘法) | 0.115 ms | 0.131 ms | 1.14x |
| Softmax | 0.114 ms | 0.240 ms | 2.11x |
| LayerNormalization (層歸一化) | 0.061 ms | 0.135 ms | 2.22x |
為什麼重要
這項釋出為瀏覽器端 AI(WebAI)生態系提供了解耦且高效能的底層積木。傳統上,WebGPU 效能會因不同 GPU 和瀏覽器架構而大打折扣。藉由將算子獨立打包、版本化,並結合眾包測試,開發者能更輕易地在網頁端部署高效能的在地模型(Local AI),不需依賴龐大且難以針對特定硬體微調的單一推論引擎。
對誰有影響
- AI 開發者
- AI 研究人員
- 企業決策者
可以怎麼使用
- 1網頁端在地 AI 推論:利用最佳化的 WebGPU 算子,在網頁瀏覽器內直接部署並執行輕量且快速的機器學習模型。
- 2自訂 WebGPU 執行期開發:以結構化的核心儲存庫作為參考實作,開發客製化的 WebGPU 執行期(Runtime)。
- 3眾包硬體效能剖析:整合 Fleet 測試套件,評估真實使用者端 GPU 的效能並偵測特定硬體的相容性問題。
限制與注意事項
- 瀏覽器與硬體相容性限制:執行這些核心需要支援 WebGPU 的瀏覽器,其可用性取決於作業系統、顯示卡及驅動程式。
- 未包含初始化開銷:效能數據僅測量 GPU 運算時間,未計入載入核心、編譯著色器(Shader)及記憶體傳輸等初始化成本。
- 目前僅限單一算子:此專案目前提供獨立的核心算子,尚未整合為完整的端到端模型推論流水線。