
NVIDIA DeveloperAI 研究
突破生成式推薦延遲瓶頸:NVIDIA Dynamo-Triton 與 PyTorch AOTI 部署 HSTU 模型實戰
Overcoming Generative Recommender Latency: Deploying HSTU Models with NVIDIA Dynamo-Triton and PyTorch AOTI
本文介紹如何透過 NVIDIA Dynamo-Triton、PyTorch AOTI 與 FlexKV 快取技術,將高延遲的 HSTU 生成式推薦模型轉化為低延遲的生產級服務,在 Blackwell GPU 上實現最高 5.93 倍的加速。
2 分鐘閱讀