在 Tesla T4 上运行 Gemma 4,第 3 部分:Int4 嵌入在 2.86 GiB 下实现比 bf16 快 2.30 倍的服务

📌 One-Sentence Summary
本文提供了分步指南,如何使用 4 位量化感知训练(QAT)缩小 Google 的 Gemma 4 2B 模型,并通过 vLLM 在 Tesla T4 上进行部署。
📝 Summary
作者详细介绍了针对受限的 NVIDIA T4 GPU 优化 Gemma 4 2B 模型的优化过程。通过利用量化感知训练(QAT)权重,作者成功将线性层压缩至 4 位,同时将嵌入表保持在 bf16。基准显示,该方法与标准 bf16 相比实现了 1.79 倍的加速,在特定配置下实现了 2.30 倍加速。指南涵盖了完整工作流:重新打包层、移除未使用的视觉/音频模块、打包嵌入,以及使用 vLLM 在不同并发级别和提示长度下评估性能。
💡 Main Points
基于 QAT 的 4 位量化
使用量化感知训练权重允许线性层压缩至 4 位,而不会出现后训练量化中常见的显著准确率损失。
混合精度策略
通过将嵌入表保持在 bf16 而将线性层量化为 int4,模型在节省内存(将加载从 9.8GB 减少到 2.86GB)的同时保持了精度。
T4 上的性能提升
优化后的模型实现了 109.7 tokens/sec,而 bf16 为 81.6 tokens/sec,这主要通过减少输出层读取的内存带宽瓶颈。
针对并发的内存优化
减少模型占用显著增加了可用 KV 缓存容量(从 315k 增加到 1.1M tokens),允许更长的上下文或更多的并发用户。
💬 Key Quotes
int4 嵌入构建版本的加载仅为 2.86 GiB,而 bf16 版本为 9.8 GiB
加速来自于输出层。在每步生成一个 token 时,T4 的解码受限于读取的字节数
打包 PLE 表节省了 3.14 GiB 且对速度没有影响……释放的内存为更多并发序列或更长的上下文留出了空间。
📊 Article Meta
AI Screening: 89
Source: DEV Community: machinelearning
Author: xbill
Category: 人工智能
Language: 英文
Read Time: 10 min
Word Count: 2327
Tags:
AI 与智能应用 , 大语言模型 (LLM) , 自动驾驶 , RAG / 检索增强 , AI 工作流
不错不错,已加入书签。
点赞,必须点赞