使用 AIPerf 对大规模 LLM 推理进行基准测试

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-191303 阅读💛 299 收藏
使用 AIPerf 对大规模 LLM 推理进行基准测试

📌 One-Sentence Summary NVIDIA AIPerf 是 GenAI-Perf 的继任者,采用多进程且由 ZMQ 协调的架构,可在不成为客户端瓶颈的情况下对大规模 LLM 推理进行基准测试,支持 15 种以上端点类型、泊松/伽马到达模式以及轨迹回放。 📝 Summary NVIDIA 推出了 AIPerf,这是对 GenAI-Perf 的彻底重写,旨在对大规模 LLM 推理进行基准测试,同时避免客户端成为性能瓶颈。与受限于 Python GIL 的单进程工具不同,AIPerf 采用多进程架构,由工作进程生成负载,并通过 ZMQ 协调独立的记录处理服务。它支持 15 种以上的端点类型(如聊天、响应、NIM 排名、图像生成)、ShareGPT 等公共数据集,以及来自 Mooncake、Baseten 和 WEKA 的轨迹回放格式。本文详细介绍了针对通过 vLLM 部署的 Qwen3-0.6B 的两次实操基准测试:一次是固定为 128/128 token 的静态合成 ISL/OSL 运行,另一次是具有可变输入/输出长度的动态泊松到达运行。文中解释了核心指标(TTFT、ITL、请求延迟、输出 token 吞吐量)、用于检测尾部延迟的分位数分解,以及通过 DCGM/pynvml 实现的 GPU 遥测。核心结论是,真实的流量模式(泊松到达、可变提示词长度)产生的延迟分布比理想化的单并发运行要宽得多,而 AIPerf 使得这种测量循环可以通过单个命令实现可重复性。 💡 Main Points AIPerf 以多进程架构取代 GenAI-Perf,避免了客户端瓶颈。 GenAI-Perf 基于 Perf Analyzer,采用单进程设计,在真实并发下会受限于 GIL。AIPerf 在架构上进行了彻底变革:工作进程生成负载,独立的记录处理服务处理结果,所有环节通过 ZMQ 协调,确保基准测试客户端不会限制服务器的实测吞吐量。 工作负载的广度与负载形状控制是核心功能,而非事后补丁。 AIPerf 支持 15 种以上的端点类型(聊天、响应、NIM 排名、图像生成)、ShareGPT 等公共数据集,以及 Mooncake、Baseten 和 WEKA 的轨迹回放格式。它还支持恒定、泊松和伽马到达模式,具备可调的突发性、渐进式启动,以及包括 vLLM/SGLang 范围比率在内的合成分布,用于模拟可变的 ISL/OSL。 静态基准测试需要显式标志来固定输出长度并启用流式传输。 如果不使用 「--extra-inputs min_tokens:128」 和 「ignore_eos:true」,模型会在自然结束时停止,导致吞吐量数值较低且不可重复。如果不使用 「--streaming」,服务器将对完整响应进行批处理,从而无法测量 TTFT 和 ITL 的首个或解码 token 事件。 真实的流量模式会揭示静态基准测试所掩盖的延迟分布。 具有可变输入长度(均值 512,标准差 128)的泊松运行产生的 TTFT 离散度远高于单并发情况,因为更多请求在竞争 GPU 访问,且预填充长度各异,预填充与解码存在重叠。分位数分解(p25-p99)至关重要,因为一个均值 TTFT 良好但 p99 异常的服务器在聚合数据中看起来正常,但在生产环境中会失效。 GPU 遥测已集成到同一运行输出中。 在可用 DCGM 或 pynvml 的情况下,AIPerf 将 GPU 功耗、利用率和内存消耗直接纳入同一运行输出中,因此将延迟峰值与内存压力事件关联起来无需单独的分析会话。 💬 Key Quotes 你需要的是一个能够使真实服务器饱和而不会成为瓶颈、能产生可操作输出且配置仅需 5 分钟而非 5 小时的负载客户端。 AIPerf 是一个多进程系统:工作进程生成负载,独立的记录处理服务处理结果,所有环节通过 ZMQ 协调。 这些分解至关重要,因为它们能突出长尾分布;一个均值 TTFT 良好但 p99 异常的服务器在聚合数据中看起来正常,但在生产环境中会失效。 单并发情况是一种理想化场景,一次仅运行一个请求,能呈现最低的 TTFT,但代价是牺牲了吞吐量。 📊 Article Meta AI Screening: 86 Source: NVIDIA Technical Blog Author: Elizabeth Goodman Category: 人工智能 Language: 英文 Read Time: 8 min Word Count: 1841 Tags: AI 与智能应用 , 性能优化 , 模型训练与推理 , 模型评测与基准 , LLM 推理优化 Read Full Article

#AI 与智能应用# 性能优化# 模型训练与推理# 模型评测与基准# LLM 推理优化

文章评论(0

暂无评论,快来抢沙发~