2026-09-22
通过NVIDIA Dynamo-Triton中的TensorRT多设备集成简化跨GPU模型服务
NVIDIA Dynamo-Triton 26.07新增TensorRT多设备推理能力,单个Triton实例可调度最多8块GPU协同执行,以Cosmos 3 Nano视频生成为例,端到端延迟从156.6秒降至34.2秒,...
NVIDIA Dynamo-Triton 26.07新增TensorRT多设备推理能力,单个Triton实例可调度最多8块GPU协同执行,以Cosmos 3 Nano视频生成为例,端到端延迟从156.6秒降至34.2秒,...