BestBlogs早报·06-06|腾讯AI下半场对谈,LangChain智能体沙箱,中国AI大厂访问记

王者归来已是老翁AI 前沿📡 觉醒AI2026-09-191380 阅读💛 269 收藏

一句话结论

三条线索拼出 Agent 落地的完整拼图:姚顺雨的下半场判断(方法论已熟,好问题与上下文数据成为新壁垒)、LangChain 的沙箱工程(智能体能力越强,越需要硬件级隔离边界)、访问团的一手观察(算力差八倍被四到七倍的效率创新弥补大半)——战略、基础设施、生态三视角互补。

导语

今天三篇精讲,从战略、工程到生态观察,覆盖 AI 落地的三个关键切面:腾讯首席 AI 科学家姚顺雨首次公开对谈,系统陈述「AI 下半场」的判断框架;LangChain 正面回应「给智能体一台什么样的电脑」这一工程命题;阮一峰整理的美国分析师访华团观感,提供了中美 AI 生态对比的稀缺一手材料。

精讲一:汤道生姚顺雨对谈——腾讯 AI 的下半场

图片

6 月 5 日,腾讯云 AI 产业应用大会上,腾讯集团高级执行副总裁汤道生与首席 AI 科学家姚顺雨同台对谈,这是姚顺雨加入腾讯后第一次在公司公开活动中正式亮相。

姚顺雨的履历颇为显赫:他是 ReAct 智能体范式的提出者,也是 OpenAI 旗下 Operator 和 Deep Research 两个 Agent 产品的核心贡献者。2025 年 12 月正式出任腾讯「首席 AI 科学家」,直接向总裁刘炽平汇报,同时兼任 AI Infra 部与大语言模型部负责人。他到任的第一个重要动作,是从 2026 年 2 月起主导重建混元团队的预训练与强化学习基础设施。

这场名为《腾讯 AI 的下半场》的约四十五分钟对谈,实际上是一次罕见的战略公开陈述——一位掌握腾讯模型方向决策权的人,第一次系统性地解释他的判断框架。

核心判断:从「怎么训练」转向「找好问题」

姚顺雨早在 2025 年 4 月就在个人博客发表过《The Second Half》,提出 AI 正站在中场分界线上的判断。八个月后,加入腾讯的决定本身,就是对这个判断的实践注脚。

他的逻辑是:过去十年,AI 领域的核心挑战是「怎么训练」——从 AlphaGo 到预训练大模型,每一项突破都是方法论层面的创新。但预训练与后训练体系建立之后,AI 相当于拥有了一把「万能锤」,可以砸向任何钉子。在这种情况下,方法论的稀缺性退场,好问题的稀缺性成为新的核心矛盾。

这意味着,AI 竞争的核心不再是谁能造出更强的模型,而是谁能定义什么问题值得解决,以及谁拥有解决这些问题所必须的数据与场景生态。

对腾讯而言,这个转变是战略性利好。他指出三个关键词:问题(腾讯有元宝、ima、CodeBuddy、WorkBuddy 等丰富产品场景)、环境(Agent 需要工具和接口才能行动,腾讯的产品矩阵提供了天然的工具生态)、上下文(最终的竞争壁垒来自谁掌握最原始的用户上下文数据,腾讯有企业与个人两端的海量积累)。他明确表示,上下文是 Agent 时代最重要的差异化因素,因为「模型越来越擅长把一个非常复杂的输入变成一个输出,你的竞争壁垒就来自于你知不知道这个人他到底在干什么」。

Hy3 Preview:495 步 Agent 工作流的背后

对谈同时披露了 Hy3 preview 的具体数据。这款参数规模为 295B 总参数、21B 激活参数的混合专家模型,在 CodeBuddy 与 WorkBuddy 上首 token 延迟降低了百分之五十四,并且能够稳定驱动最长四百九十五步的复杂 Agent 工作流。上线 OpenRouter 后,一度拿下周榜调用量与市场份额双第一。

值得注意的是,Hy3 preview 版本明确定位为「以实用性为导向」,不是为了刷榜,而是为了收集真实世界反馈,修复榜单无法发现的底线问题。姚顺雨对此的解释颇为务实:基准测试有价值,但容易饱和;真实世界的提示词分布更复杂、更模糊、多轮,这些是基准测试无法覆盖的训练信号来源。

Co-Design:模型与产品如何深度协同

汤道生提出的「Co-Design」概念,是整场对谈的另一条主线。他以「产品老兵」的视角,描述了 AI 时代做产品与 PC、移动互联网时代的本质不同:过去的产品像「预制菜」,通过功能菜单满足需求;AI 产品则面对完全开放式的用户输入,产品方甚至无法预知用户会问什么,必须依赖模型能力来理解并响应。这种变化倒逼组织形态向小团队化、实验驱动靠拢,工程师的角色从「写功能」变为「驱动多个编码智能体的产品负责人」。

姚顺雨对 Co-Design 的拆解分三点:其一,预训练是相对与产品无关的,做得扎实可以为多个下游产品提供可泛化的基础;其二,后训练的关键是设立正确的评估——以元宝为例,真实对话中用户的问题比基准测试更模糊、更多轮,这些真实反馈可以发现基准测试发现不了的底线问题;其三,大模型时代与过去 AI 最本质的区别是泛化性——即使目标是编码智能体,也需要聊天、搜索、指令遵循、推理等多维度能力,这意味着有多元产品矩阵的公司,数据之间可以相互泛化,形成网络效应。

对谈结尾,汤道生宣布腾讯将发布一套「效率智能体工具集」,背后整合了场景连接、Harness 工程体系与混元模型 Co-Design 三重能力。

外界质疑腾讯「慢了」,姚顺雨的回答是:如果 AI 是一场长期游戏,下半场才刚刚开始,那现在并非晚了;ChatGPT 和 Claude 不会是唯一的超级应用,编码智能体之外还有大量新的产品范式等待探索。这个判断背后的逻辑链——方法论成熟、好问题稀缺、上下文是壁垒——值得每位 AI 从业者认真推敲。

精讲二:给你的 AI 智能体一台专属电脑

图片

智能体能力提升的速度,远远超过了智能体安全基础设施建设的速度。LangChain 的这篇文章,正面回应了一个越来越迫切的工程命题:当 Agent 需要执行代码、访问文件系统、安装依赖、持久化状态时,应该给它一台什么样的「电脑」?

萨提亚·纳德拉在微软 Build 大会上的判断被引为文章开篇:「每个智能体都需要一台电脑。」这不是比喻,而是字面意义上的基础设施需求。Cursor、Claude Code、ChatGPT 的代码解释器之所以强大,正是因为它们拥有了一个可以运行代码、看到错误、修复再跑的反馈闭环——这个反馈闭环,是区分演示 Agent 与生产 Agent 的关键分界线。

为什么容器不够用:两个真实案例

许多团队在早期原型阶段选择 Docker 容器来隔离 Agent 执行环境。文章以两个具体案例指出,这种方案在生产环境中遭遇两道硬墙。

第一道:Agent 本质上执行不可信代码。Agent 运行的代码可能来自模型生成、用户提示词、克隆的仓库,或者安装的第三方包。没有任何一条路径是完全可信的。2025 年 9 月,npm 生态出现了自我复制蠕虫 Shai-Hulud,在预安装阶段感染了超过五百个包,第二波在 11 月进一步波及七百九十六个包和两万五千多个 GitHub 仓库,且感染发生在任何验证逻辑执行之前。一个会安装 npm 包的 Agent,天然暴露在这类供应链攻击面前。

第二道:容器共享宿主内核,不是真正的隔离边界。一个仅七百三十二字节的 Python 脚本,利用 Linux 内核加密接口漏洞,可以提权至宿主机 root 权限,覆盖从 2017 年到现在几乎所有主流 Linux 发行版。文章点出了一个令人不安的细节:AI 工具链发现这个漏洞大约用了一小时。

这两个案例放在一起,说明了一个清晰的工程结论:对于模型生成或用户可控代码,容器隔离是不够的,需要硬件级别的隔离边界。

microVM 的设计哲学

LangSmith Sandboxes 给出的答案是基于硬件虚拟化的 microVM。与容器不同,microVM 拥有独立内核,每个沙箱实例之间不共享任何内核级别的资源,内核漏洞无法跨越边界影响宿主机或其他沙箱。

这个方案的工程特性覆盖了 Agent 执行场景的主要需求:无服务器级启动速度(微秒级冷启动,而非传统虚拟机的秒级,对于需要按需弹起、用完即毁的 Agent 沙箱场景,这是关键);完整机器持久状态(沙箱拥有完整的文件系统、进程空间和网络栈,Agent 可以在同一沙箱内持续工作数小时,维护跨步骤的状态,而不是每次调用都重置环境);快照与分叉(可以对沙箱状态打快照,并从同一快照分叉出多个并行实例,这对强化学习训练和批量评测场景极为重要);蓝图预热(预先配置好的沙箱环境可以池化复用,避免重复安装依赖的冷启动延迟)。

文中描述了一组典型的 Agent 使用场景:一个编码助手不只是建议修复方案,而是应用修复方案、运行测试套件、确认没有破坏已有功能;一个持续集成智能体可以克隆仓库、安装依赖、跑完整测试、开合并请求;一个强化学习评测环境需要从零到数千个沙箱的弹性扩缩容。这些场景的共同前提:Agent 需要一个有状态的、持续的、安全的工作空间。

这篇文章与精讲一构成有趣的互文:一篇讨论 Agent 能做什么,另一篇讨论 Agent 在什么样的基础设施上才能安全地做。Hy3 preview 能够稳定驱动数百步复杂 Agent 工作流,恰恰需要精讲二所描述的基础设施作为前提。对于正在构建 Agent 代码执行系统的工程师,这篇文章是当日最具工程价值的必读材料。

精讲三:科技爱好者周刊(第 399 期)——中国 AI 大厂访问记

图片

2026 年 5 月上旬,一个由多位美国科技分析师组成的访问团赴华,走访了十四家 AI 与机器人公司,包括 DeepSeek、月之暗面、MiniMax、智谱、字节跳动、阿里、蚂蚁、小米、零一万物、宇树、魔搭社区等头部机构。访问结束后,多位成员独立撰文分享观感,阮一峰在本期周刊中将关键摘录系统整理,配以简洁导读。

这是少见的中美 AI 生态直接对比一手材料。不是二手数据引用,不是媒体转述,而是身处硅谷的分析师在中国实地观察后形成的第一手认知。

算力:差距是真实的,但效率弥补了大半

访问团的最核心发现,围绕算力展开,且得出了两组看似矛盾实则互补的结论。

差距的量级方面:中国 AI 公司普遍反映算力不足,根本原因是芯片出口管制。英伟达最新款系统在实时推理速度上比三年前的 H100 集群快三十倍,每颗芯片内存容量高出三点六倍,每次推理能耗降低二十五倍,美国公司正在大量订购,而中国公司无法获取。访问团估计,2025 年底美国 AI 算力约为中国的八倍,中国目前的总算力大致相当于美国 2023 年的规模。

效率的弥补方面:「算力少一个数量级」并不等于「模型能力落后两年」。访问团的关键发现是,芯片管制反而逼出了计算效率创新——中国公司的单位算力支持的 AI 智能是简单扩展下的四到七倍。分析师们向中国研究人员透露了 OpenAI 内部每位研究人员拥有的 GPU 数量,对方「简直惊呆了」,然而西方 AI 公司的研究人员仍然普遍抱怨算力不够。这个细节揭示了两种截然不同的稀缺性适应策略。

此外,中国的算力分配结构与美国不同:美国的大部分算力用于模型训练,中国的算力同时要服务数亿消费者和快速增长的企业用户,这进一步压缩了可用于训练的资源池,也是促进效率创新的另一个驱动因素。

组织与文化:年轻、流动、产学一体

访问团的另一组引人注目的观察聚焦在人。中国 AI 公司的员工平均年龄二十五六岁,大多数仍是博士在读,实习期长达一到两年,享有与全职员工相同的权限和待遇,可以自由提出想法、开展工作实验。

这与西方顶级 AI 公司形成鲜明对比:OpenAI、Anthropic、Cursor 等公司根本不提供实习,其他公司的实习机会也不会涉及核心模型工作。背后有结构性原因:中国顶尖高校的计算资源根本无法满足优秀博士生的研究需求,而业界公司拥有更丰富的算力。双方的利益在「合作发论文、提供算力与全权限」这个模型下找到了交汇点,形成产学高度交融的人才生态。

开源分歧、竞争格局与 AI 安全态度

开源分歧方面,一条越来越清晰的界线正在形成——参数规模达到一万亿。部分公司认为开源万亿参数模型是资源浪费,因为没人能在本地运行如此庞大的模型;另一些公司则将开源视为信仰和入场券。

竞争格局方面,访问团观察到字节跳动 Seed 部门被全行业敬畏——因为豆包几乎垄断了 AI 用户流量,且他们的模型可以快速推广到海量用户。DeepSeek 则是最受业界尊重的公司,越来越多地承担基础架构层工作。

AI 安全态度方面,访问团与年轻中国研究人员讨论通用人工智能,得到了几乎相同的答案:「通用人工智能就是 AI 可以取代我!」对方不只是不害怕,而是对「机器是否真的能超越其制造者」充满好奇。这与西方同行形成鲜明对比。

这篇文章的价值不在于任何单一数字,而在于跨越信息不对称的整体视角。与精讲一(腾讯对上下文数据与问题寻找的战略判断)连读,可以得到更完整的中国 AI 发展图景:一篇是内部视角的战略逻辑,一篇是外部视角的生态素描。

速览

如何写好 Skill:一份终极实战经验手册 腾讯工程师整理的 Skill 编写完整方法论,从基础概念、结构设计,到高级技巧、安全规范与工程化评估,覆盖「从没写过 Skill」到「负责团队规范」的完整阅读路径。核心洞察:Skill 本质上是结构化的提示词工程,它把分散在人脑中的领域知识与流程经验,转化为 AI 可执行的指令集。文章详解渐进式加载机制(元数据常驻、SKILL.md 触发加载、附件按需引用),指出编写时的常见反模式。正在或计划用 Claude Code、CodeBuddy 等工具提升团队工程效率的读者,这份手册值得当作参考文档收藏。

图片

从客户经理到产品经理:Anthropic 销售员如何用 Claude Code 重建团队工作流 Anthropic 客户经理 Jared Sires 没有任何编程背景,却用 Claude Code 从零构建了一个嵌入 Gmail 的邮件起草工具。他每天要处理十到十五个客户电话,加上大量外发邮件,经常工作到晚上九、十点。这套工具最终每周为他节省十到十五小时,分享到内部沟通群后,二十四小时内整个销售团队开始使用。这个案例最有价值的地方,不只是「非技术人员也能用 AI 编程」,而是它展示了 AI 原生工具如何重塑角色定义——Jared 随后转型为产品经理,专门识别销售组织的流程问题并构建 AI 解决方案。

微软 Build 主题演讲:智能体工程取代了编程 一条被广泛共鸣的观察:微软长达三个半小时的 Build 主题演讲,全程没有提及 C#、.NET 或 TypeScript。这三个词曾长期是微软开发者大会的标配符号。这不是偶然的遗漏,而是一个关于技术叙事重心转移的清晰信号:编程语言让位于智能体工程,底层工具让位于能力与流程的整合。

首字延迟降低 3.6 倍,腾讯混元提出 Stem 稀疏注意力算法 腾讯混元发布论文,提出两项核心创新:Token 位置衰减和输出感知度量。前者洞察来自因果注意力架构的递归特性——初始位置的 token 被所有后续层依赖,不应被稀疏化;后者在传统注意力分数之外,引入 Value 向量携带的信息量作为 token 选择依据。两项创新组合,在仅用四分之一算力的条件下逼近稠密注意力的精度,实现长上下文首字延迟显著降低,已开源。这个成果对 Agent 工作流场景尤为重要——长上下文推理是 Agent 的高频场景。

千符森林:在 3B 模型上运行一个多智能体经济系统 一份工程实验报告:五个运行在 Qwen2.5-3B 上的林地生物 Agent,在微型经济中以石子为货币相互交易、闲聊、囤积与恐慌,最终涌现出价格泡沫、崩溃与财富分化。作者的核心结论:三十亿参数级别的模型是可靠的格式生成器,但是不可靠的推理器——它可以稳定输出结构化数据、遵循格式约束,但在真正需要策略推理的场景表现不稳定。另一个值得记录的洞察:「涌现出的戏剧性需要人为设计的稀缺性」。对于正在探索小模型多 Agent 场景的工程师,这份实地报告比理论分析更直观。

Text Diffusion:面向低延迟语言生成的新一代架构 谷歌研究人员解释了文本扩散模型作为自回归大模型生成替代方向的工作原理与权衡:放弃因果约束,改用全双向注意力块,允许从噪声中并行解码整个序列,而非逐 token 生成。代价是单次前向计算量更大,但在特定延迟场景下有优势。这是值得长期追踪的架构方向,尤其适合对推理延迟有严格要求的工程师和研究者。

当 AI 开始构建自己 Anthropic 递归自我改进进展报告的中文完整翻译,援引了一组内部数据:截至 2026 年 5 月,Anthropic 工程师合并进代码库的代码中超过八成由 Claude 编写,每位工程师每季度交付的代码量是此前数年间平均水平的八倍。报告梳理了从「聊天机器人」到「自主智能体」的阶段演变,并讨论了三种关于递归自我改进的未来场景。适合对 AI 发展趋势有系统性思考需求的读者。

补充阅读

如何避免交付低质量的强化学习环境 来自谷歌强化学习团队的研究员系列文章,专注于环境质量问题:低质量的测试框架会系统性地生成垃圾训练数据,破坏模型性能。文章提供了常见故障的分类、具体示例与修复方法。适合正在构建强化学习训练基础设施的工程师,可与今日精讲二(Agent 执行环境安全)配合阅读。

谷歌发布 Gemma 4 12B:具备高级推理能力的开放模型 谷歌发布最新开放模型 Gemma 4 12B,整合高级智能体推理、视觉与音频能力,采用统一架构(移除独立多模态编码器),设计在仅需 16GB 显存的本地硬件上运行,Apache 2.0 授权。这是开源模型生态的又一次能力跳跃,关注本地部署与开源社区的读者值得关注。

Qwen3.7-Max 挑战谷歌争夺第三 本期内容包含四条有价值的信息:阿里 Qwen3.7-Max 的市场竞争布局、AI 系统用于防止鲸鱼与船只相撞的公益案例、中国大模型访问的灰色市场现象,以及微调可能破坏版权对齐的研究结论。内容跨度广,适合希望保持 AI 领域综合情报视野的读者。

基于顶级编码智能体的 Harness 工程搭建式业务 Agent 评测方案 阿里云工程师提出创新评测方案:以 Claude Code 作为 Harness 工程的搭建者和运行者,将评测逻辑从代码转化为提示词,实现对业务 Agent 的系统性、快速评测。核心矛盾是业务 Agent 迭代快(天级)但传统评测工程搭建慢(周级),这套「Agent 评测 Agent」的思路打破了这个瓶颈。

Claude Code 团队内部的 5 条工作原则 解读 Claude Code 工程总监的分享,提炼 AI 原生组织下规划、自动化、代码评审、团队角色与流程变革的五条工作原则。核心判断:在 Agent 时代,写代码已不再是工程瓶颈,瓶颈转移到了验证、代码评审与安全,所有上下游流程都需要重新设计。

Skills 中的渐进式披露:大型智能体流程的最强模式 解释在 Skills 中记录大型智能体流程的渐进式披露模式,分为启动(约五百 token 元数据常驻)、任务匹配(SKILL.md 触发加载)和深度执行(附件按需引用)三个阶段,通过按需加载把 token 消耗优化到最低。这是第一篇速览「如何写好 Skill」的工程补充,两篇配合阅读,可以对 Skill 设计的宏观原则与微观优化有更完整的认知。

今日阅读路径

时间有限?推荐按以下顺序选读:

  • 精讲一:腾讯 AI 的下半场——如果你只读一篇,读这篇。ReAct 提出者给出的一手战略陈述,无论对从业者还是观察者都值得逐字读。
  • 精讲二:给你的 AI 智能体一台专属电脑——工程侧最重要的基础设施文章,容器与虚拟机的边界讨论直接决定 Agent 生产的选型。
  • 精讲三:中国 AI 大厂访问记——换一个外部视角看中国 AI 生态,两组关于算力与效率的对比数据是全文最有信息量的部分。

原文信息

原文地址:

  • 作者:BestBlogs(@hongming731),BestBlogs.dev 主理人,AI 驱动内容精选服务
  • 发布时间:2026-06-05
  • 来源:X Article

文章评论(0

暂无评论,快来抢沙发~