GitHub - SpectraSI/SpectraAdamw:通过因子化方差和频域压缩减半优化器状态内存

清风徐来AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-10-10579 阅读💛 248 收藏
GitHub - SpectraSI/SpectraAdamw:通过因子化方差和频域压缩减半优化器状态内存

📌 One-Sentence Summary

SpectraAdamW 通过因子化方差近似和频域动量压缩将优化器状态内存减少 50%,同时保持全精度收敛,用于 LLM 微调。

📝 Summary

SpectraAdamW 解决了 LLM 微调中的内存瓶颈问题,通过压缩优化器状态。它采用因子化方差近似来消除完整的方差矩阵,并使用频域压缩来减小动量的体量,实现了 50% 的 VRAM 减少,同时保持了收敛的稳定性。

💡 Main Points

因子化方差近似(FVA)

将二阶矩分解为行均值和列均值,将状态从 O(N×M) 降到 O(N+M)。这消除了方差状态的内存占用,同时保持了正值、有界的除数,以实现稳定的更新。

频域动量压缩

通过 FFT 将梯度变换到频域,允许动态屏蔽低影响的频率。这压缩了动量的存储大小,而不会丢失结构完整性,为整体的 50% 内存降参贡献了力量。

在模拟基准测试中,SpectraAdamW 将优化器状态 VRAM 从 256.00 MB 减少到 128.16 MB(降参 50%)。损失曲线与标准 AdamW 完全一致,表明收敛质量没有下降。

💬 Key Quotes

在消费级硬件上对大型语言模型进行微调时,主要内存瓶颈并不是模型权重,而是优化器状态。

📊 Article Meta

AI Screening: 88

Source: Hacker News - Newest: "LLM"

Author: KanishkIndia

Category: 人工智能

Language: 英文

Read Time: 2 min

Word Count: 414

Tags:

AI 与智能应用 , 模型训练与推理 , AI 工程 , 开源项目 , 大语言模型 (LLM)

#AI 与智能应用# 模型训练与推理# AI 工程# 开源项目# 大语言模型 (LLM)

文章评论(0)

暂无评论,快来抢沙发~