Aivora
NVIDIA Developer開源進階

NVIDIA 推出 DIN Deploy:用 C++ 與 TensorRT RTX 打造高效能地端 AI 應用程式

NVIDIA DIN Deploy: Building High-Performance Local AI Apps with C++ and TensorRT RTX

2 分鐘閱讀
NVIDIA 推出 DIN Deploy:用 C++ 與 TensorRT RTX 打造高效能地端 AI 應用程式
30 秒看懂

DIN Deploy 是一個開源的 C++ 範例集合,旨在解決地端 AI 應用程式在不同系統上的加速與相容性挑戰。它採用「Python 導出模型、C++ 執行推理」的解耦設計,並使用 ONNX Runtime (ORT) 整合 TensorRT RTX 執行提供者。專案涵蓋 Whisper 語音識別、SAM 2.1 互動式影像分割及 FLUX.2 圖像生成等多種熱門模型,並在 GPU 加速下展現出顯著超越 CPU 的效能優勢。

核心重點

01

解耦的雙階段架構

利用 Python 將 Hugging Face 的模型權重轉換為 ONNX 格式,再由原生 C++ CLI 進行推理,實現模型轉換與部署邏輯的徹底分離。

02

RTX 顯示卡硬體加速

透過 ONNX Runtime 與 TensorRT RTX 執行提供者,開發人員無須撰寫複雜的 vendor 專屬程式碼,即可自動獲得極佳的 GPU 推理加速。

03

多模態主流模型支援

內建支援 Whisper 與 Parakeet 語音識別、SAM 2.1 影像分割,以及 FLUX.2 圖像生成等多種先進開源模型。

04

高效的繪圖互通與量化

FLUX.2 範例展示了 ORT 與 Vulkan 及 DirectX 的繪圖互通,並透過 NVIDIA Model Optimizer 進行後訓練量化,在不修改程式碼下提升效能。

為什麼重要

地端 AI 應用程式開發長期受限於環境配置複雜與跨平台效能優化困難。DIN Deploy 為 C++ 開發人員提供了一套現成的標準化樣板,極大地降低了調用 TensorRT RTX 顯示卡硬體加速的門檻。透過這一工具,企業與獨立開發者能以極低代碼修改量,將最新 AI 模型無縫整合進傳統桌面軟體(如影音編輯、即時通訊),大幅加速地端 AI 生態系的成熟。

對誰有影響

  • AI 開發者
  • 產品經理
  • 內容創作者

可以怎麼使用

  1. 1低延遲語音聽寫:利用 Whisper 或 Nemotron 在地端應用程式中實現即時會議紀錄或語音控制。
  2. 2互動式影像編輯:在相片或影片剪輯軟體中整合 SAM 2.1,實現快速、高精準度的地端物件去背與追蹤。
  3. 3隱私安全的圖像生成:使用量化後的 FLUX.2 模型,在無需連接網際網路的情況下,提供高效率的文字生成圖片功能。

限制與注意事項

  • 極致效能高度依賴特定硬體,在非 NVIDIA RTX GPU 或僅使用 CPU 的環境下,加速效果會大打折扣。
  • 部分進階功能具平台局限性,例如繪圖互通 API 中 DirectX 僅能在 Windows 上運行,Linux 系統則須改用 Vulkan。

延伸閱讀

打造 AI 原生專案:NVIDIA TensorRT Model Connect 的開發啟示
NVIDIA Developer開源

打造 AI 原生專案:NVIDIA TensorRT Model Connect 的開發啟示

Designing AI-Native Software: Lessons from NVIDIA TensorRT Model Connect

NVIDIA 分享如何圍繞 AI 代理(Coding Agent)重新設計軟體架構,透過模型家族隔離、可逆變更與 GPU 自動驗證,成功擴充 TensorRT Model Connect 開源專案。

2 分鐘閱讀
NVIDIA Topograph:實現拓撲感知排程,徹底釋放 AI 工廠 GPU 效能
NVIDIA Developer開源

NVIDIA Topograph:實現拓撲感知排程,徹底釋放 AI 工廠 GPU 效能

Topology-Aware Workload Scheduling with NVIDIA Topograph

NVIDIA Topograph 是一款開源工具套件,能自動偵測雲端與地端叢集的網路及硬體拓撲關係,並將其標準化後提供給 Kubernetes 和 Slurm 排程器,大幅減少跨節點通訊延遲並提升運算效率。

2 分鐘閱讀