421M 参数的决策模型能跑多快?我在 NVIDIA GPU 上对 Laya 做了基准测试

📌 One-Sentence Summary
作者在多种 NVIDIA GPU 上对 421M 参数的决策模型 Laya 进行基准测试,以确定生产软件层可持续的决策吞吐量和 p99 延迟。
📝 Summary
本文对 Laya 进行了独立的性能分析。Laya 是一个「系统 1」模型,旨在输出结构化决策(选择、评分、是/否),而非生成式文本。研究评估了多种硬件(从 RTX 2000 到 H100 NVL)和服务后端(PyTorch eager、torch.compile、ONNX、TensorRT)。关键发现包括:性能随容量填满而急剧下降的「延迟拐点」、在动态服务场景中 torch.compile 优于 TensorRT,以及 MIG 切片不适合较长文档工作流。
💡 Main Points
「延迟拐点」非常陡峭
GPU 性能在批处理器填满之前保持稳定,一旦填满,p99 延迟会从约 100ms 飙升至数秒,超出 SLO。
TensorRT 并非万能赢家
在动态服务场景中,torch.compile(max-autotune) FP16 在 Hopper 和 Blackwell 架构上针对高吞吐决策的表现优于 TensorRT。
MIG 切片不如一整块 H100
虽然 12GB MIG 切片提供了良好的隔离性,但在负载下无法满足超过 400 token 文档所需的 130ms 要求。
与上游保持一致至关重要
作者使用了一组 63 个问题的对照集,以确保量化或后端变更等优化不会改变原始 FP32 输出。
💬 Key Quotes
Laya 将一个状态加上一个带类型的问题转化为一个决策。
平均延迟掩盖了这种行为;p99 才将其暴露出来。
如果答案变了,再快也毫无意义。
一天 1000 万次决策,一台工作站 GPU 就够了。
📊 Article Meta
AI Screening: 86
Source: DEV Community: machinelearning
Author: Bhushan Kinge
Category: 人工智能
Language: 英文
Read Time: 5 min
Word Count: 1162
Tags:
AI 与智能应用 , AI 工程 , 机器学习 , LLM 推理优化 , AI 硬件与芯片
暂无评论,快来抢沙发~