MiniMax M3 如何构建:稀疏注意力与原生多模态训练|Olive Song

📌 One-Sentence Summary
MiniMax 研究员 Olive Song 解释了 M3 如何结合适配 GQA 的稀疏注意力与原生图文预训练,以及块级检索和从零融入视觉能力为何影响长上下文效率与视觉理解。
📝 Summary
Olive Song 介绍 MiniMax M3:这款开放权重模型支持百万 token 上下文、编码智能体任务,并从预训练起始阶段融入视觉能力。其稀疏注意力先由轻量索引分支选出候选,再交给主分支计算。MSA 没有让 GQA 的各个 KV 头共用同一选择结果,而是保留各头不同的选取;块级检索则减少 top-k 候选数量,让显存读取更连续。讲者称,这些设计使预填充和解码较全量注意力更快,但演讲未交代基准测试口径和内核细节。在多模态训练上,团队比较了文本模型收敛后再加视觉、预训练衰减阶段前加入视觉,以及从零共同训练图文三种策略。讲者表示,最后一种在相同文本 token 预算下基本保住了文本能力,注意力图也显示图文融合更充分。她还指出,ViT 内的四帧 3D 注意力在视觉收益与效率之间取得了较好平衡。这些一手工程取舍具有参考价值,但转录提供的量化证据有限。
💡 Main Points
MSA 将候选选择与主稀疏注意力计算分开。
轻量索引分支近似注意力分数,为主分支选出输入,使长上下文计算只覆盖部分 token,而非全部 token。
稀疏选择需要兼顾 GQA 的头部差异和 GPU 访存方式。
各 KV 头共用一套选择结果会抹平 GQA 的多样性。MiniMax 保留不同选择,并以块级检索降低 top-k 和零散显存读取的开销。
从预训练开始引入视觉能力,有望减少文本能力损失。
Song 比较了后期继续训练、中途加入视觉与从零共同训练图文,称最后一种在相同文本 token 预算下让文本性能下降更少。
跨帧注意力增强时序表示,也带来系统成本。
ViT 中的 3D 注意力让不同帧的图像块直接交互;团队认为四帧设置在视觉收益、效率和负载均衡之间最合适。
💬 Key Quotes
我们的核心设计原则是:更简单的架构往往能带来更好的规模扩展特性。
然而,top-k 本身存在数据依赖。
这有助于保留 GQA 的多样性,而不是迫使所有头共享同一种稀疏注意力模式。
一个实际限制是,我们不能无限增加 3D 注意力处理的帧数,否则会带来额外的系统和负载均衡挑战。
📊 Article Meta
AI Screening: 91
Featured: Yes
Source: AI Engineer
Author: AI Engineer
Category: 人工智能
Language: 英文
Read Time: 8 min
Word Count: 1956
Tags:
AI 与智能应用 , 长上下文 , 上下文工程 , 模型训练与推理 , AI研究前沿
Play Full Video
暂无评论,快来抢沙发~