GGUF 与 GPTQ 与 AWQ 与 EXL2:LLM 模型格式详解 (2026)

空逐月AI 前沿📡 BestBlogs·AI高分精选⭐ 872026-09-19471 阅读💛 70 收藏
GGUF 与 GPTQ 与 AWQ 与 EXL2:LLM 模型格式详解 (2026)

📌 One-Sentence Summary 一份 2026 年综合指南,区分模型容器与量化方法,涵盖 GGUF、GPTQ、AWQ、EXL2 / EXL3、bitsandbytes 与 MLX,并提供针对硬件的 LLM 部署建议。 📝 Summary 文章阐明了文件容器(safetensors、GGUF)与量化方法(GPTQ、AWQ、EXL2 / 3)之间的关键区别。详述了 GGUF 面向 CPU / Apple Silicon 的分块 K-quant 与重要性矩阵校准;GPTQ 基于 Hessian 的一次性量化与 AWQ 的激活感知通道保护,用于通过 vLLM / SGLang 进行 GPU 服务;以及 EXL2 / EXL3 面向单用户消费级 GPU 的混合精度、列级优化。文章指出 AutoGPTQ / AutoAWQ 已停止维护,由 GPTQModel 与 llm-compressor 取代。对比表将格式映射至校准需求、硬件目标与运行时。指南最后给出决策矩阵:GGUF 适用于 Mac / CPU / 超大模型;AWQ / GPTQ / FP8 适用于数据中心服务;EXL3 适用于消费级 NVIDIA GPU 的最大 tokens / 秒;bitsandbytes NF4 适用于 QLoRA 微调;MLX 适用于 Apple Silicon Python 工作流。 💡 Main Points 容器与量化方法是正交概念;大多数量化模型仍使用 safetensors 作为磁盘容器。 文章首先将存储布局(safetensors、GGUF、PyTorch pickle)与压缩技术(GPTQ、AWQ、llama.cpp K / I-quant)分离。这避免了将 GGUF 误认为量化方法而非一种可容纳多种量化方案的自描述二进制格式的常见混淆。 GGUF 仍是 CPU、Apple Silicon 及混合 CPU / GPU 推理的默认选择,提供丰富的分块量化等级与可选的重要性矩阵校准。 GGUF 的类型化键值元数据实现了不破坏旧文件的扩展性。其 K-quant(Q2_K – Q6_K)与 I-quant(IQ1_S – IQ4_XS)提供细粒度的体积 - 质量权衡,llama.cpp 的 imatrix 工具可利用校准数据进一步提升低比特保真度。 GPTQ 与 AWQ 是 vLLM / SGLang 中 GPU 服务的成熟 4-bit 主力,但其原始库(AutoGPTQ、AutoAWQ)已弃用,推荐使用 GPTQModel 与 llm-compressor。 GPTQ 利用近似 Hessian 信息进行一次性训练后量化;AWQ 保护通过激活幅度识别的关键权重通道。两者均需校准数据集。文章强调 2026 年工具链变化:GPTQModel 取代 AutoGPTQ 用于 Transformers / vLLM / SGLang,而 vLLM 通过 llm-compressor 集成 AWQ。 EXL2 与 EXL3 面向消费级 NVIDIA GPU,通过细粒度混合精度量化与程序化码本,追求单用户最大吞吐。 EXL2 支持 2 – 8 bpw 任意平均比特率并采用列级混合;EXL3 采用 QTIP 的格子编码量化,使 Llama-3.1-70B 在 1.6 bpw 下保持连贯(3-bit 输出层可装入 一份实用的硬件感知选择指南将各格式映射至其最佳部署场景。 文章以决策矩阵收尾:GGUF 适用于 Mac / CPU / 超大模型;AWQ / GPTQ / FP8 在 Hopper / Blackwell 上用于多用户服务;EXL3 通过 TabbyAPI 在消费级 GPU 上实现峰值 tokens / 秒;bitsandbytes NF4 用于 QLoRA 微调;MLX 用于 Apple Silicon Python 工作流。 💬 Key Quotes 首先,区分两个概念:容器与量化方法 GGUF 是 CPU、Apple Silicon 及混合 CPU + GPU 本地推理的默认选择。 AutoGPTQ 与 AutoAWQ 已停止维护;请改用 GPTQModel 或 llm-compressor。 EXL3 保留 QTIP 的程序化码本与格子编码……Llama-3.1-70B 在每权重 1.6 比特下仍保持连贯。 权重显存 ≈ 参数量 × 每权重比特数 ÷ 8。 📊 Article Meta AI Screening: 87 Source: MarkTechPost Author: Asif Razzaq Category: 人工智能 Language: 英文 Read Time: 10 min Word Count: 2315 Tags: AI 与智能应用 , 模型训练与推理 , AI 工程 , 大语言模型 (LLM) , 消费与零售 Read Full Article

#AI 与智能应用# 模型训练与推理# AI 工程# 大语言模型 (LLM)# 消费与零售

文章评论(0

暂无评论,快来抢沙发~