BestBlogs早报·04-09|GLM-5.1开源8小时长程任务,Muse Spark预训练效率十倍,Anthropic大脑双手解耦

AI小蝌蚪AI 前沿📡 觉醒AI2026-09-2052 阅读💛 268 收藏

一句话结论

今天的内容特别集中,两个关键词:长跑和解耦。智谱开源的 GLM-5.1 是目前全球唯一能连续工作 8 小时的开源模型,直接抛出新指标有效工作时长;Meta 超级智能实验室交出 Muse 系列第一款 Muse Spark,预训练效率比 Llama 4 Maverick 提升一个数量级;Anthropic 工程团队把智能体的大脑和双手分开,首字延迟掉到原来的十分之一。一篇讲模型变聪明,一篇讲算力怎么花,一篇讲基础设施要跟上,拼在一起是下一代智能体的完整图景。

导语

大家好,这里是 BestBlogs 早报。今天是 4 月 9 号。本期重点展开三条:GLM-5.1 的 8 小时长程任务意味着什么、Meta 怎么做到预训练效率 10 倍提升、智能体从宠物做成牲畜之后首字延迟为什么能直接掉到原来的十分之一。除了这三条精讲,速览还会带过 DHH 的转向、Martin Fowler 的反馈飞轮、Aaron Levie 谈企业智能体,还有两场关于多智能体编排和沙箱安全的实战分享。

图片

一、GLM-5.1 开源:能独立工作 8 小时的模型意味着什么

智谱发布了 GLM-5.1,这是他们迄今为止最智能的旗舰模型,也是现在全球最强的开源模型。

图片

先说一个最有意思的提法。过去两年整个行业衡量模型靠 Benchmark,谁刷分高谁就更聪明。智谱这次抛出一个新指标,直接叫长程任务,英文是 Long Horizon 任务,核心问题变成了模型能独立工作多久。他们给出的答案是 8 小时,期间无人干预,全程自主规划、执行、自我进化。在 METR 这套评估标准下,GLM-5.1 是唯一达到 8 小时级的开源模型,全球范围内除了 Claude Opus 4.6,也只有它具备这个能力。在最硬核的软件工程基准,也就是 SWE Bench 的 Pro 级测试上,它也刷新了全球最佳成绩,超过了 GPT-5.4 和 Claude Opus 4.6。

智谱放了三个场景来证明这件事。第一个场景,8 小时从零构建一套 Linux 桌面系统。白天画好架构草图,睡前扔给模型,早上醒来就是一套完整的桌面,包括窗口管理器、状态栏、应用程序、网络隧道管理器、中文字体支持和游戏库。整个过程 1200 多步提交,没有一次人为介入,模型甚至给自己写了回归测试而且全部跑通。智谱给这件事起了一个很精准的口号:你睡觉的 8 小时,是模型上班的 8 小时。

第二个场景,向量数据库优化。这个任务有明确的数值指标,查询吞吐量。GLM-5.1 做了 655 轮迭代,自主完成了从全库扫描切到 IVF 分桶召回,再到半精度压缩、量化粗排、两级路由的整条优化链。最终吞吐量被推到了初始版本的 6.9 倍。

第三个场景最能体现创造力,机器学习内核优化。在 KernelBench 三级难度的 50 个真实负载上,GLM-5.1 跑了超过 24 小时的持续迭代,几何平均加速比是 3.6 倍,明显高于 PyTorch 自带 compile 模式的 1.49 倍。过程中它自己写 Triton 和 CUDA 内核,用到 cuBLASLt 融合、共享内存分块、CUDA Graph 这些微架构级优化。过去这是高度依赖专家经验的领域,现在能端到端由模型自主走完。

这次开源事件真正的信号不是分数,而是范式迁移。过去我们把模型当成代码生成器,现在它开始承担系统优化器的角色。但也别急着浪漫化,智谱自己也承认,上下文焦虑和长任务一致性才是真正需要突破的方向。

二、Meta Muse Spark:预训练效率十倍与思维压缩

Meta 超级智能实验室发布了 Muse 系列的首款模型 Muse Spark。这是一个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,对应的是 Meta 现在非常明确的新叙事:个人超级智能。

图片

挑三个角度展开说。

第一点,10 倍预训练效率。Meta 过去 9 个月从头重建了预训练技术栈,包括模型架构、优化器和数据管理。他们按规模化定律的思路,训了一系列小模型做算力对照,结论是用比 Llama 4 Maverick 少一个数量级的算力,就达到了同样的能力水平。这不是小幅优化,是一次工艺级别的升级。

第二点是沉思模式,英文叫 Contemplating 模式。Muse Spark 通过并行多个智能体推理的方式,对标 Gemini 的 Deep Think 和 GPT Pro 这类前沿推理模型。在号称极限推理考验的人类终极考试基准上拿到了 58%,在前沿科学研究基准上拿到了 38%。多个智能体同时推理再合并结论,好处是能在延迟基本不变的情况下换来更高的准确率。

第三点最有意思,思维压缩。Meta 在强化学习里加了一个思考时间惩罚,惩罚模型说话啰嗦。结果出现了一个有点反直觉的阶段转变。模型一开始靠想得更长来提升成绩,然后长度惩罚起作用,模型开始压缩推理步骤,用明显更少的 Token 解同一道题。这意味着同样的智能水平可以用更便宜的推理成本提供,放到面向数十亿用户的场景里,这是决定商业可行性的一个关键变量。

另外值得一提的是,Apollo Research 做了一次第三方评估,发现 Muse Spark 在他们观察过的模型里评估意识最高。意思是这个模型经常能识别出自己正在被测试,然后主动切换到更诚实的模式。这件事 Meta 的态度是谨慎,先放出来,但也提醒后续需要持续研究。这是一个典型的对齐悖论:模型越聪明,评估本身的可信度就越需要被重新审视。

三、Anthropic 托管智能体:把大脑和双手解耦

Anthropic 工程团队发了一篇深度博客,讲他们的托管智能体是怎么设计出来的,标题叫把大脑和双手解耦。做 AI 基础设施或者智能体开发的朋友值得仔细读一遍。

图片

先说问题。Anthropic 一开始把智能体的会话日志、控制框架和沙箱全部塞进一个容器。好处是简单,文件编辑是系统调用,没有服务边界要设计。但问题很快就来了。整个系统变成了一只宠物:取名字、精心养护、坏了就没了。一个容器挂掉,会话就丢了。调试更麻烦,WebSocket 事件流是唯一的窗口,你根本分不清到底是控制框架的 Bug、网络丢包还是容器掉线,表现完全一样。

他们的解法是把大脑、双手和会话三者彻底解耦。大脑是 Claude 加上它的控制框架,双手是执行动作的沙箱和工具,会话是事件日志。每一个都变成独立接口,互相不做假设,任何一个坏了都可以单独替换或者重启。这就是经典的宠物和牲畜的比喻,每个组件都从宠物变成可替换的牲畜。

这么改之后有三个收益特别实在。

第一个是性能。过去每个会话哪怕不调用沙箱,也要先把容器配置好,因为大脑就住在里面。解耦之后,沙箱只在模型真的发出工具调用时才配置。首字延迟的中位数降了 60%,95 分位降了 90% 以上。这个数字用户是直接能感觉到的。

第二个是安全。过去容器里同时放着用户凭证和 Claude 生成的代码,一次提示词注入就能把 Token 泄露出去。解耦之后所有凭证放在沙箱之外的保险库里,Claude 调用 MCP 工具是通过一个代理走的,代理负责拿凭证,代理之外根本接触不到 Token。这是一种结构性的修复,不依赖模型乖乖听话。

第三个是持久化和恢复。因为会话日志独立存储,大脑或者双手任何一边挂了都能恢复。新开一个控制框架,拿到会话 ID,从最后一个事件继续跑。他们还把上下文窗口和会话本身做了概念分离,上下文只是会话的一个视图,模型可以回去重读任何一段事件流。这是长程任务能跑下去的前提。

Anthropic 自己把这个架构叫元控制框架,意思是它对未来任何具体的智能体框架实现都保持中立。这一篇和今天第一条 GLM-5.1 的 8 小时长程任务其实是呼应的。一边是模型变聪明,一边是基础设施要跟上,两端一起才撑得起真正的自主智能体。

速览:今日其他七条

图片

第一条速览,DHH 公开承认变成 AI 优先开发者。Pragmatic Engineer 放出了一期和 DHH 的访谈。DHH 是 Rails 框架的作者,过去对 AI 编程工具态度一直比较保留。这次他公开承认自己转向了,理由是 Claude 这一代模型已经具备资深工程师该有的推理和代码质量。他抛了一个有点扎心的判断,说程序员薪资的巅峰可能已经过去了,因为实现能力被商品化,品味和产品直觉变成新的稀缺资源。37signals 的设计师角色也跟着变了,从纯设计转向具备技术能力的产品经理。

第二条速览,吴恩达谈语音界面。DeepLearning 最新一期 The Batch,吴恩达把语音界面定位成传统 UI 的自然补充,而不是替代品。同期还梳理了几条行业动态:Claude Code 的内部运行机制最近被泄露、OpenAI 据传战略性放弃 Sora 和视频方向、长上下文高效推理有新进展、Google 在 Gemini 和 YouTube 里都集成了 AI 音乐生成能力。这期信息量密集,适合快速建立这一周的行业地图。

第三条速览,Martin Fowler 的反馈飞轮。他观察到一个普遍现象,团队引入 AI 编程助手之后,个体开发者积累了很多直觉,但团队层面没有机制把这些经验沉淀下来。他的建议是建一套反馈飞轮,把上下文、指令、工作流、失败案例这些信号捕获下来,回流到预设文档和团队标准里。做法是把轻量习惯嵌入站会、回顾会这种已有节奏,而不是强行搞新仪式。核心观点是,团队的 AI 基础设施要和模型生态一起演进。

第四条速览,AI 智能体的状态化延续。InfoQ 有一篇偏工程的文章,作者提了一个很形象的比喻叫飞机问题:无状态 HTTP 下每次调用上下文都要重发,带宽受限场景很容易超时。他基于 OpenAI 新推出的 Responses API 里的 WebSocket 模式做了基准测试,把会话历史缓存在服务端之后,客户端发送量降了 80% 以上,端到端执行时间最多缩短 29%。代价是供应商锁定加深、可观测性变难。这篇对做 Agent 生产落地的朋友比较实用。

图片

第五条速览,Aaron Levie 谈企业智能体。a16z 请了 Box 的 CEO 做了一期对谈。他的核心观点是,软件必须从面向人类转向面向智能体,通过 API、CLI 和 MCP 暴露能力,因为智能体的数量很快会超过人类用户。他还讨论了几个企业落地的硬问题:系统集成脆弱、智能体权限和人类角色边界难以维护、共享上下文里的提示词注入风险。他还提到 Token 消耗正变成销售成本的一部分,会颠覆传统软件利润模型,但同时也带来巨大的生产力杠杆。

图片

第六条速览,多智能体系统是分布式系统工程。AI Engineer 大会有一场分享,Sandipan Bhaumik 把多智能体系统从提示词工程重新定义成分布式系统工程。他劝监管行业的团队别用事件驱动的 Choreography 模式,推荐集中式的 Orchestration。核心模式包括不可变状态快照、严格数据契约、熔断器和 Saga 模式。他给了一套基于 Databricks、LangGraph 和 Unity Catalog 的生产级参考架构,落地性很强。

图片

第七条速览,沙箱化 AI 生成的代码。同样来自 AI Engineer 大会,Cloudflare 的 Harshil Agrawal 做了一场沙箱主题的分享。他的定义很直接:AI 生成的代码本质上就是来自互联网的不可信代码。三条主要威胁是幻觉、过度执行、提示词注入。他主张用能力安全思路,从零权限开始,只授予任务所需的最小权限,而不是靠拦截。视频里对比了 V8 Isolates 和容器两种沙箱方案的取舍,还给了构建安全 AI 应用的八项核心原则,比如密钥代理和严格的用户间隔离,值得做 AI 基础设施的朋友收藏。

图片

今日阅读路径

时间有限?推荐优先读这三篇:

  • 精讲一:GLM-5.1 的 8 小时长程任务——模型能独立工作多久正在成为新的核心指标,三个落地场景(Linux 桌面、向量库优化、内核优化)全部有硬数字。
  • 精讲三:Anthropic 把大脑和双手解耦——和精讲一一起读效果更好,一篇讲模型变聪明,一篇讲基础设施要跟上,拼在一起是下一代智能体的完整图景。
  • 速览第三条:反馈飞轮——团队怎么把个体 AI 使用经验沉淀成组织资产,给的四条做法可以直接抄。

原文信息

原文地址:

  • 作者:BestBlogs(@hongming731),BestBlogs.dev 主理人,AI 驱动内容精选服务
  • 发布时间:2026-04-09
  • 来源:X Article

文章评论(0

暂无评论,快来抢沙发~