「[AINews] Xiaomi MiMo-V2.6-Pro 1T-A42B:训练成本 300 万美元的新顶尖开源权重模型」

清风徐来AI 前沿📡 BestBlogs·AI高分精选⭐ 852026-09-22108 阅读💛 88 收藏
「[AINews] Xiaomi MiMo-V2.6-Pro 1T-A42B:训练成本 300 万美元的新顶尖开源权重模型」

📌 One-Sentence Summary 小米发布 MiMo-V2.6-Pro,这是一款性能顶尖的开源权重全模态模型,采用高度透明且高性价比的 RL 技术栈训练,同时反映出行业正向专业化决策模型和测试时计算转移。 📝 Summary 小米通过 MiMo-V2.6 系列(包括 Pro 和 Flash 模型)进入前沿 AI 领域。MiMo-V2.6-Pro 目前在 Artificial Analysis Intelligence Index 中排名开源权重模型第一,其特点是原生全模态,且 RL 运行的训练成本约为 300 万美元。小米通过开源其 RL 环境和训练方案脱颖而出,这表明高质量的 RL 环境正成为模型规模化的新战略杠杆。除小米外,AI 领域还出现了如 Jev 等用于低延迟路由的「决策模型」热潮,推理端(KV 缓存和量化)得到了显著优化,且计算重心正从预训练转向智能体的测试时计算。 💡 Main Points 小米 MiMo-V2.6-Pro 为开源权重的效率与性能建立了新基准。 该模型拥有 1.02T 总参数和 42B 激活参数,在 Artificial Analysis Intelligence Index 中领先。其 RL 训练极具成本效益(130 小时耗时 260 万美元)且透明,利用 JAX + TPU 实现了快速规模化。 RL 环境正成为与预训练语料库相当的关键战略资产。 小米决定开源涵盖编程、网络安全和视觉任务的约 7K 个 RL 环境及训练方案,这表明 RL 「数据工厂」的质量已成为获得前沿性能提升的主要驱动力。 针对特定任务,市场对专业化「决策模型」的需求正超过通用前沿模型。 Jev 和 SemIf 等模型的流行证明了在路由、工具选择和分类任务中,需要「无需思考、单 Token」的智能,这比全规模 LLM 具有更好的延迟和成本表现。 AI 基础设施正向测试时计算和先进推理优化转移。 行业趋势显示,计算重心正从边际递减的预训练收益转向测试时计算。这一趋势得到了 KV 缓存(如 QwenImage 2.1)和高压缩量化(如 Hy4 Preview)等工程突破的支持。 💬 Key Quotes 「高质量的开源 RL 环境现在可能与上一个周期中的预训练语料库一样具有战略重要性。」 「规模化「在很大程度上是配置的更改,而非代码的重写」。」 「无需思考,单 Token,低延迟可接受的智能」 📊 Article Meta AI Screening: 85 Source: Latent.Space Author: Latent.Space Category: 人工智能 Language: 英文 Read Time: 10 min Word Count: 2256 Tags: AI 与智能应用 , 强化学习 , AI 工程 , 模型训练与推理 , 多模态 AI Read Full Article

#AI 与智能应用# 强化学习# AI 工程# 模型训练与推理# 多模态 AI

文章评论(0

暂无评论,快来抢沙发~