GitHub - SpectraSI/SpectraAdamw:通过因子化方差和频域压缩减半优化器状态内存

📌 One-Sentence Summary
SpectraAdamW 通过因子化方差近似和频域动量压缩将优化器状态内存减少 50%,同时保持全精度收敛,用于 LLM 微调。
📝 Summary
SpectraAdamW 解决了 LLM 微调中的内存瓶颈问题,通过压缩优化器状态。它采用因子化方差近似来消除完整的方差矩阵,并使用频域压缩来减小动量的体量,实现了 50% 的 VRAM 减少,同时保持了收敛的稳定性。
💡 Main Points
因子化方差近似(FVA)
将二阶矩分解为行均值和列均值,将状态从 O(N×M) 降到 O(N+M)。这消除了方差状态的内存占用,同时保持了正值、有界的除数,以实现稳定的更新。
频域动量压缩
通过 FFT 将梯度变换到频域,允许动态屏蔽低影响的频率。这压缩了动量的存储大小,而不会丢失结构完整性,为整体的 50% 内存降参贡献了力量。
在模拟基准测试中,SpectraAdamW 将优化器状态 VRAM 从 256.00 MB 减少到 128.16 MB(降参 50%)。损失曲线与标准 AdamW 完全一致,表明收敛质量没有下降。
💬 Key Quotes
在消费级硬件上对大型语言模型进行微调时,主要内存瓶颈并不是模型权重,而是优化器状态。
📊 Article Meta
AI Screening: 88
Source: Hacker News - Newest: "LLM"
Author: KanishkIndia
Category: 人工智能
Language: 英文
Read Time: 2 min
Word Count: 414
Tags:
AI 与智能应用 , 模型训练与推理 , AI 工程 , 开源项目 , 大语言模型 (LLM)
#AI 与智能应用# 模型训练与推理# AI 工程# 开源项目# 大语言模型 (LLM)
暂无评论,快来抢沙发~