1.25 比特压到 214GB:Hy4 权重瘦身 7 倍的三元量化拆解
Hy4 preview 的模型权重从 1.5TB 降到了 214GB,官方发布图跳过了最关键的三个技术细节。这篇拆解补全它们:为什么是 1.25 比特、为什么模型没有塌、为什么恰好落在 Hy4 上。
为什么是 1.25 比特
三元量化的思路很老:把每个权重变成 -1、0、+1 三值,乘法就退化成加法——这正是 CPU 和廉价边缘芯片最想要的算术形态。难点从来在打包环节。
硬件按二的幂次计数,三个值装不进去。十年来所有人都把”零”当作三元化的代价:权重里死重的那一位。
Sherry 方案反过来了:不付零的账,而是让零干活。强制每四个权重一组、组内恰好持有一个零,零的位置本身就成了信息——四个槽位、三种符号,共 32 种状态,正好装进 5 比特,一点不浪费。折算下来每权重 1.25 比特,且四路分组天然对齐硬件通道的运行方式。
算术一句话就写完,真正的巧思是意识到”零可以承担工作”。
为什么模型不塌
发布图还跳过了第二个问题:训练时强制 3:4 稀疏直接收工,权重会向二值漂移,丢掉你付费买的三元表达范围。
研究团队把根因定位到权重陷阱(weight trapping):稀疏约束让梯度同质化,各处更新长得越来越像,模型悄悄从三元退化成 1 比特。
修法叫 Arenas:训练期加一份全精度残差,随训练退火到零。它打破梯度对称性,让权重保住三元多样性。训练结束残差归零,推理零开销——只留稀疏三元权重。
为什么落在 Hy4 preview 上
最后一环是架构契合。Hy4 preview 是个 770B 参数的 MoE 大模型,每 token 只激活 49B(约 6.4%),走 256 个专家中的 8 个加一个共享专家。
这份冗余恰恰是激进量化最不疼的地方:专家层供给严重过剩,可以在那里狠压,敏感层保持宽位。这是一次架构层面的下注,也说明 Sherry 不是论文技巧,而是在真实 770B MoE 上跑起来的方法。
给部署者的启示
把模型压小只是容易的部分,让零有用武之地才是难的部分。对需要本地部署超大模型的团队,这条路线把”消费级硬件跑 770B”从玩笑变成了可评估的选项:1.25 比特三元权重 + 推理零开销残差 + MoE 冗余分层压缩,三个组件都可独立复用到同类模型上。
论文地址:arxiv.org/abs/2601.07892
开源代码:github.com/Tencent/AngelSlim
部署侧怎么用
对评估本地部署的团队,AngelSlim 仓库提供了可复现的量化训练与转换流程:准备待压缩的 MoE 模型检查点,配置 3:4 稀疏分组与 Arenas 残差参数跑量化训练,导出的三元权重可直接对接支持三值算子的推理引擎。评估时重点测试目标任务的精度回退曲线,再决定敏感层保留宽度——这是整套方法里唯一需要按模型调的旋钮。
原文信息
作者:Tencent AI News(@tencentai_news)
原文地址:
作者写得真不错,学到了不少。
支持作者,持续关注中。
看完了,收获满满,期待更多更新。
这个比较实用,已转发给同事。
这篇文章分析得很透彻,收藏了!
这篇文章分析得很透彻,收藏了!
实测过类似工具,作者说的基本属实。