Back to Home
RadarAI··Papers & Tech

NVIDIA 机密计算如何让 TensorRT LLM 生产级 AI 推理保留 96% 以上吞吐

中文摘要

NVIDIA Blackwell GPU使用机密计算运行TensorRT LLM,保持96%以上吞吐量,TPOT开销仅1.2%-4.3%。

English Summary

NVIDIA Blackwell GPUs using Confidential Computing for TensorRT LLM retain over 96% throughput with 1.2%-4.3% TPOT overhead.

Original Excerpt

NVIDIA 用机密计算(CC)在 Blackwell GPU 上跑 TensorRT LLM 生产级推理,CC 开启后仍保留 CC 关闭基线 96.1%-98.2% 的输出 token 吞吐,平均 TPOT 开销仅 1.2%-4.3%。