像物理学家一样剪枝 LLM:将模块移除视为伊辛优化问题

📌 One-Sentence Summary 本文提出了一种 LLM 模块移除方法,将其重新表述为映射到伊辛玻璃的约束二元优化问题,从而实现高效、高性能的深度剪枝,并考虑了模块间的相互作用。 📝 Summary 作者提出了一种新颖的 LLM 深度剪枝方法,将模块选择视为约束二元优化(CBO)问题,并直接映射到伊辛玻璃模型。与将 Transformer 模块视为独立的传统「平均场」方法不同,该方法使用二阶泰勒展开来捕捉模块之间的成对「耦合」或相互作用。通过最小化所得自旋系统的能量,研究者无需昂贵的基准测试即可识别出高性能的剪枝配置。该方法计算效率高,因为 Hessian 矩阵只需计算一次,后续的能量评估极其廉价。实证结果表明,在 Llama-3.3-70B-Instruct 上以 50% 压缩率进行剪枝时,CBO 方法在 MMLU 上比现有基线高出近 23 个百分点。此外,该方法可推广到混合 Mamba/MoE 模型等异构架构,并表明能谱中的「激发态」有时能产生比绝对基态更好的模型。 💡 Main Points 由于模块间的相互作用,模块移除是一个组合问题。 传统方法将模块视为独立(平均场),但移除一个模块会影响其他模块的作用。该方法使用 Hessian 矩阵来捕捉这些成对耦合。 重新表述为伊辛玻璃优化。 选择过程被映射为一个约束二元优化问题,其中自旋系统中的低能态对应于高性能的剪枝模型。 计算效率与可扩展性。 Hessian 矩阵在一个小数据集上计算一次,后续的能量评估极其廉价,从而允许使用经典或量子启发式求解器来探索巨大的配置空间。 深度压缩中的卓越性能。 对于 Llama-3.3-70B-Instruct,在 50% 压缩率下,CBO 方法在 MMLU 上比最先进的基线高出 23 个点。 对异构架构的泛化能力。 伊辛公式适用于不同的模块类型,包括混合 Mamba、注意力层和 MoE 层,且无需重新训练。 💬 Key Quotes 移除错误的模块会导致模型崩溃;而移除任何一个模块的效果取决于你同时移除了哪些其他模块,因此这些选择是相互影响的。 自旋系统的低能态对应于高性能的剪枝模型。 最好的模型是一个激发态,而不是基态。 当你进行深度剪枝时,耦合最为重要。 📊 Article Meta AI Screening: 91 Featured: Yes Source: Hugging Face - Blog Author: Antonio Tiene, Ali Hashemi, David Jansen, Roman Rausch Category: 人工智能 Language: 英文 Read Time: 7 min Word Count: 1738 Tags: AI 与智能应用 , 模型训练与推理 , AI 工程 , LLM 推理优化 , 开源项目 Read Full Article
暂无评论,快来抢沙发~