Aivora
Hugging Face開源進階

Hugging Face 整合 llama.cpp:在 Transformers 中直接執行 GGUF 量化模型

Transformers Meets llama.cpp: Direct GGUF Inference on Apple Silicon

2 分鐘閱讀
Hugging Face 整合 llama.cpp:在 Transformers 中直接執行 GGUF 量化模型
30 秒看懂

此更新突破了以往在 Mac 本機執行量化模型需依賴 llama.cpp 等獨立引擎的限制。現在開發者只需使用熟悉的 PyTorch 與 Transformers API,配合全新的 kernels 庫,即可直接載入並在 Apple Silicon 上流暢執行 GGUF 模型。此整合不僅消除了反量化的記憶體開銷,還優化了 PyTorch 的生成迴圈,減少 CPU 與 GPU 之間的同步等待,帶來極佳的本機推論速度與開發彈性。

核心重點

01

核心直接整合

透過 kernels 庫,直接將 ggml 的 Metal 核心整合至 PyTorch,無需將整個模型替換為外部推論引擎。

02

優化生成迴圈

提早移除無用的 Attention Mask 並非同步延遲停止檢查,大幅重疊 CPU 任務與 GPU 運算,提升所有模型的 token 產出率。

03

無縫銜接標準 API

相容 AutoModelForCausalLM、自訂 logits 處理器,甚至可直接解量化(dequantize)模型進行微調訓練。

04

本機 OpenAI 相容 API

利用 `transformers serve` 快速啟動伺服器,將本機執行的模型輕鬆連接至 Pi 或 Jan 等 AI Agent 與對話終端。

技術圖解

Qwen3.5-4B GGUF 規格量化比較
BF16Q6_KQ5_K_MQ4_K_M
檔案大小8.42 GB3.53 GB3.14 GB2.74 GB
權衡特性未量化之參考基準比更小的量化版本保留更多精確度檔案大小與精確度之間的折衷平衡點適合本機推論的實用建議起點

為什麼重要

此更新打破了「本機高效推論」與「彈性學術研究」之間的隔閡。研究人員不再需要為了效能而在獨立的 C++ 執行環境與 PyTorch 之間做選擇。現在,你可以直接使用 Python、PyTorch 的 hooks 觀察中間張量、修改 Forward Pass,同時享受 ggml 核心帶來極致的硬體加速與低記憶體佔用。

對誰有影響

  • AI 開發者
  • AI 研究人員
  • 企業決策者

可以怎麼使用

  1. 1在 Mac 本機使用 PyTorch 快速載入、測試與評估 GGUF 格式的 LLM。
  2. 2透過本地一鍵部署指令建立 API 伺服器,支援整合至本機的開發代理程式(Coding Agent)。
  3. 3對 GGUF checkpoint 直接解量化,並接續進行 PyTorch 模型微調。

限制與注意事項

  • 目前打包的量化推論路徑僅支援 Apple Silicon (MPS) 平台。
  • 模型架構支援尚有限,目前初期僅支援 Qwen3.5 的 dense 與 MoE 架構以及相容的 Qwen3.8 checkpoints。

延伸閱讀

打造 AI 原生專案:NVIDIA TensorRT Model Connect 的開發啟示
NVIDIA Developer開源

打造 AI 原生專案:NVIDIA TensorRT Model Connect 的開發啟示

Designing AI-Native Software: Lessons from NVIDIA TensorRT Model Connect

NVIDIA 分享如何圍繞 AI 代理(Coding Agent)重新設計軟體架構,透過模型家族隔離、可逆變更與 GPU 自動驗證,成功擴充 TensorRT Model Connect 開源專案。

2 分鐘閱讀
NVIDIA Topograph:實現拓撲感知排程,徹底釋放 AI 工廠 GPU 效能
NVIDIA Developer開源

NVIDIA Topograph:實現拓撲感知排程,徹底釋放 AI 工廠 GPU 效能

Topology-Aware Workload Scheduling with NVIDIA Topograph

NVIDIA Topograph 是一款開源工具套件,能自動偵測雲端與地端叢集的網路及硬體拓撲關係,並將其標準化後提供給 Kubernetes 和 Slurm 排程器,大幅減少跨節點通訊延遲並提升運算效率。

2 分鐘閱讀