NVIDIA DSX MaxLPS 如何最大化 AI 工厂吞吐量与效率

📌 One-Sentence Summary
NVIDIA DSX MaxLPS 利用动态功率共享回收 AI 工厂中的闲置容量,在不超出静态功率预算的前提下,实现 GPU 密度提升 37% 及每瓦吞吐量提高 49%。
📝 Summary
本文详细解析了 NVIDIA 与 Nscale 联合对 DSX MaxLPS(一种基于策略治理的 AI 工厂动态功率分配系统)进行的评估。传统静态配置为每个节点预留峰值功率,但由于工作负载波动,正常运营期间大量容量未被利用。DSX MaxLPS 监控实时遥测数据,并在固定的总预算内动态重新分配可用余量至参与资源。在使用 Kimi K2.5 工作负载于 GB300 NVL72 系统的测试中,该方法允许在相同的 264.4 kW 功率限制内部署 192 个 GPU,而非基线的 140 个。这使得聚合吞吐量增加了 49.2%,效率从 4.10 tokens/s/W 提升至 6.12 tokens/s/W。虽然中位延迟保持稳定,但 P99 首 Token 时间增加了 17%,凸显了对尾延迟进行严格验证的必要性。文章为运营商提供了一套五步框架,以安全地验证和部署此类动态功率策略。
💡 Main Points
静态功率配置造成「闲置容量」,限制了 AI 工厂的可扩展性。
运营商通常预留足够的功率以确保所有节点能同时达到峰值消耗。然而,AI 工作负载(训练和推理)具有可变的功率特征,包含空闲或低功耗阶段。这种不匹配导致设施通常在远低于其批准功率限值的情况下运行,尽管存在电气余量,却无法部署额外的 GPU。
DSX MaxLPS 通过动态重新分配,在相同功率预算内支持最多增加 40% 的 GPU 部署。
该系统使用一个控制循环,涉及拓扑映射、高频遥测、运营商定义的策略以及动态分配。通过根据实时需求在节点间转移功率限值,它允许更多 GPU 并发运行而不违反站点总功率约束。在评估场景中,这将受管 GPU 数量从 140 增加到 192(+37.1%),同时将总测量功率保持在配置的 264.4 kW 预算内。
每瓦吞吐量显著提升,但必须监控尾延迟权衡。
评估显示聚合吞吐量增加了 49.2%,效率从 4.10 tokens/s/W 提升至 6.12 tokens/s/W。单实例吞吐量保持稳定。然而,虽然中位数和 P75 延迟保持在基线值的 5% 以内,但 P99 首 Token 时间增加了 17%。这表明动态功率共享可能会引入最坏情况响应时间的变异性,因此生产部署需要严格的验收标准。
成功部署需要一个分阶段的验证过程,重点关注代表性工作负载和遥测可靠性。
NVIDIA 推荐采用五步方法:定义管理边界、在静态条件下建立代表性基线、引入保守策略、在测试每个阶段的同时逐步增加容量、设定最终的生产限值。主要风险包括遥测不准确、工作负载混合不具备代表性,以及在峰值需求下隐藏的服务质量退化。
💬 Key Quotes
每一瓦未使用的功率都是被浪费的容量。
在静态的单节点预留模式下,一个预留内的未使用容量无法应用于另一个节点。
动态功率分配使工程权衡在集群层面变得可观察且可控;但它并不能消除这些权衡。
稳定的中位延迟可能掩盖尾延迟的变化。
DSX MaxLPS 为运营商提供了一个将工作负载变异性转化为受管容量的框架。
📊 Article Meta
AI Screening: 86
Source: NVIDIA Technical Blog
Author: Sarah McKenney
Category: 人工智能
Language: 英文
Read Time: 7 min
Word Count: 1619
Tags:
AI 与智能应用 , AI基础设施 , 性能优化 , 模型训练与推理 , LLM 推理优化
暂无评论,快来抢沙发~