421M 参数的决策模型能跑多快?我在 NVIDIA GPU 上对 Laya 做了基准测试

星海拾光AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-25695 阅读💛 80 收藏
421M 参数的决策模型能跑多快?我在 NVIDIA GPU 上对 Laya 做了基准测试

📌 One-Sentence Summary

作者在多种 NVIDIA GPU 上对 421M 参数的决策模型 Laya 进行基准测试,以确定生产软件层可持续的决策吞吐量和 p99 延迟。

📝 Summary

本文对 Laya 进行了独立的性能分析。Laya 是一个「系统 1」模型,旨在输出结构化决策(选择、评分、是/否),而非生成式文本。研究评估了多种硬件(从 RTX 2000 到 H100 NVL)和服务后端(PyTorch eager、torch.compile、ONNX、TensorRT)。关键发现包括:性能随容量填满而急剧下降的「延迟拐点」、在动态服务场景中 torch.compile 优于 TensorRT,以及 MIG 切片不适合较长文档工作流。

💡 Main Points

「延迟拐点」非常陡峭

GPU 性能在批处理器填满之前保持稳定,一旦填满,p99 延迟会从约 100ms 飙升至数秒,超出 SLO。

TensorRT 并非万能赢家

在动态服务场景中,torch.compile(max-autotune) FP16 在 Hopper 和 Blackwell 架构上针对高吞吐决策的表现优于 TensorRT。

MIG 切片不如一整块 H100

虽然 12GB MIG 切片提供了良好的隔离性,但在负载下无法满足超过 400 token 文档所需的 130ms 要求。

与上游保持一致至关重要

作者使用了一组 63 个问题的对照集,以确保量化或后端变更等优化不会改变原始 FP32 输出。

💬 Key Quotes

Laya 将一个状态加上一个带类型的问题转化为一个决策。

平均延迟掩盖了这种行为;p99 才将其暴露出来。

如果答案变了,再快也毫无意义。

一天 1000 万次决策,一台工作站 GPU 就够了。

📊 Article Meta

AI Screening: 86

Source: DEV Community: machinelearning

Author: Bhushan Kinge

Category: 人工智能

Language: 英文

Read Time: 5 min

Word Count: 1162

Tags:

AI 与智能应用 , AI 工程 , 机器学习 , LLM 推理优化 , AI 硬件与芯片

#AI 与智能应用# AI 工程# 机器学习# LLM 推理优化# AI 硬件与芯片

文章评论(0)

暂无评论,快来抢沙发~