通过 NVIDIA Dynamo-Triton 中的 NVIDIA TensorRT 多设备集成简化多 GPU 模型服务

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-221256 阅读💛 236 收藏
通过 NVIDIA Dynamo-Triton 中的 NVIDIA TensorRT 多设备集成简化多 GPU 模型服务

📌 One-Sentence Summary NVIDIA Dynamo-Triton 26.07 集成了 TensorRT 多设备推理,通过单个 gRPC 端点简化多 GPU 模型服务,并利用 Ulysses 上下文并行加速 Cosmos 3 Nano 视频生成。 📝 Summary NVIDIA Dynamo-Triton(原 Triton Inference Server)26.07 版本引入了对 TensorRT 多设备推理的原生支持,允许单个模型实例利用 NCCL 分布式集合在多个 GPU 上执行。该集成将多 GPU 协调从客户端抽象化,仅暴露一个 gRPC 端点。本文通过 NVIDIA Cosmos 3 Nano 视频生成模型演示了这一能力,采用 Ulysses 上下文并行将视频 Token 分布在最多 8 个 GPU 上。基准测试显示,端到端延迟从单 GPU 的 156.6 秒降低至 8 个 GPU 的 34.2 秒(加速 4.58 倍),同时视觉质量保持在可接受的 MAE 和 PSNR 阈值内。 💡 Main Points 通过 Dynamo-Triton 实现统一的多 GPU 服务 Dynamo-Triton 26.07 集成了 TensorRT 的多设备推理,允许单个模型实例(KIND_MODEL)管理多个 GPU、秩执行上下文(rank execution contexts)和 NCCL 通信器。这提供了一个统一的 gRPC 端点,消除了客户端应用程序处理多 GPU 协调的复杂性。 用于视频生成的 Ulysses 上下文并行 该集成在 Cosmos 3 Nano 模型上得到了验证,其中 Ulysses 上下文并行将 44,160 个视频 Token 分布在最多 8 个 GPU 上。Ulysses 在 36 个 Transformer 层中的每个注意力头沿序列进行分区,并使用 TensorRT 分布式集合层(reduce-scatter, all-to-all, all-gather)。 显著降低延迟但呈现非线性扩展 从 1 个 GPU 扩展到 8 个 GPU 使 Cosmos 3 的端到端延迟降低了 78.17%(从 156.6s 降至 34.2s)。虽然 Transformer RPC 的加速比达到了 6.09 倍,但整体扩展是非线性的,因为随着推理时间的缩短,固定的客户端开销(提示词处理、VAE 解码、调度)成为了更大的瓶颈。 输出质量验证 为了确保分布式执行不会降低模型精度,输出结果与单设备基准进行了验证。所有多 GPU 配置(CP2, CP4, CP8)均成功通过了 MAE = 18 dB 的质量阈值配置。 💬 Key Quotes 应用程序通过 gRPC 端点调用一个命名模型,而无需自行协调 GPU 秩。 Dynamo-Triton 配置激活了该方案;它并非将单设备引擎转换为分布式引擎。 对于产品团队而言,这些结果证明了当响应时间比最小化单个请求分配的 GPU 数量具有更高商业价值时,这是一个切实可行的方案。 📊 Article Meta AI Screening: 86 Source: NVIDIA Technical Blog Author: Tanya Lenz Category: 人工智能 Language: 英文 Read Time: 5 min Word Count: 1184 Tags: AI 与智能应用 , 模型训练与推理 , 性能优化 , LLM 推理优化 , NVIDIA Read Full Article

#AI 与智能应用# 模型训练与推理# 性能优化# LLM 推理优化# NVIDIA

文章评论(0

暂无评论,快来抢沙发~