BestBlogs早报·08-03|Igor Babuschkin 谈模型开发,Whatnot 反思 PM 配置,姚顺雨腾讯 300 天

邱宇AI 前沿2026-09-17226 阅读💛 14 收藏

导语

一个组织应该把能力放在哪里,往往比能力本身更难回答。前 xAI 联合创始人 Igor Babuschkin 把这个问题落在模型训练、个人 Agent 与本地硬件上;Whatnot 的 CPO Tom Verrilli 则从产品团队内部追问,为什么 PM 不该按固定比例成为默认岗位;《晚点聊》观察的,是姚顺雨加入腾讯后,混元怎样在人、模型和业务之间重新建立连接。

这三篇材料并不构成一条统一结论。第一篇是创业者对未来技术路线的判断,第二篇是一家公司的组织实践,第三篇则是媒体对大厂内部变化的复盘。把它们并排阅读的价值,在于分清愿景、方法和已发生的组织事实各自能支持多强的判断。

如果时间有限,可以依次读 River AI 的三项押注、Whatnot 对 PM 中间层问题的处理,再看腾讯混元的改革为何仍要接受产品结果检验。昨天的早报讨论了长时程 Agent 的训练与评测,本期则进一步把「可验证」带进模型路线和组织设计:说法是否成立,最终仍取决于反馈闭环能否运转。

★ 精讲一:xAI 联合创始人 Igor Babuschkin 解读模型开发的未来

Igor Babuschkin 的判断从一个已发生的变化出发:编程 Agent 之所以率先变得可用,很大程度上因为代码能够执行、测试和比较,模型可以得到清晰奖励。数学也有类似条件,Lean 等形式化工具能帮助检查证明。可一旦 Agent 进入材料科学、基础物理或其他真实世界任务,想法是否有效往往要靠实验反馈,数据闭环变慢,奖励也不再容易定义。因而,从「会写代码」外推到「会完成任意长期工作」之间,还隔着环境、评测和反馈基础设施。

图片

这也是他创办 River AI 后选择三个项目的背景。第一项是面向企业的强化学习与微调服务 River API,目标是把后训练做得更便宜、可靠并可扩展,让拥有专有数据的组织能够塑造自己的模型。这里的机会来自开放权重模型进步与企业数据之间的组合:基础模型提供通用能力,企业的任务轨迹和反馈决定专业表现。但数据独特并不自动带来优势,组织仍需能把业务结果转成训练信号,并持续验证模型有没有学到真正需要的行为。

第二项押注是个性化 Agent。现有模型通常汇总大量用户反馈,优化一个适合「平均用户」的行为;Babuschkin 希望模型能从单个用户的持续交互中学习,让表达方式、偏好与行动选择逐渐因人而异。这听起来接近个人助理的理想形态,却也把隐私、偏好漂移和目标定义推到前台:系统既要知道用户想要什么,也要避免把短期点击或一时情绪误当成长远利益。访谈将它作为仍处早期的研究方向,而非已经验证的产品答案。

第三项是把更强的推理算力带到办公室或家庭的本地设备。Babuschkin 认为,若训练和推理始终只发生在少数公司的数据中心,个人对模型访问、数据和行为边界的控制就会受制于平台。本地硬件有望让敏感数据留在用户一侧,也可能支持更深的个人化;代价则是算力、能耗、散热、模型更新与安全维护都要在设备端重新权衡。这条路线的吸引力在控制权,难点却不是简单把云端模型缩小。

访谈还谈到开放权重与专有模型的竞争。Babuschkin 预期,若专有模型的领先幅度收窄,企业会更愿意基于开放模型做分布式后训练;但开放降低门槛的同时,也会放大安全与治理争议。Reuters 能独立确认他曾在 DeepMind、OpenAI 工作并参与创办 xAI,但 River AI 的三项路线及其对行业格局的预测仍是创业者观点。阅读时更值得追踪的是三个可观察变量:企业后训练是否形成可复用闭环,个性化是否带来稳定而非偶然的改善,本地设备能否在成本与体验上接近云端服务。

来源:跨国串门儿计划 · BestBlogs 评分:90

★ 精讲二:Why Whatnot 的 CPO 认为产品经理不应成为默认配置

Whatnot CPO Tom Verrilli 的主张并不是「公司不需要产品经理」,而是不要因为工程师数量增加,就按固定比例自动补充 PM。他回顾产品管理成为专业岗位的过程:团队规模扩大后,需要有人汇总客户、商业和技术信息;但当 PM 长期承担传话与协调,工程师和设计师可能逐渐失去直接接触客户、理解业务取舍并形成判断的机会。岗位填补了信息缺口,也可能固化信息缺口。

图片

因此,Whatnot 更倾向于在出现具体问题时招聘 PM,例如跨团队决策失速、用户洞察无人负责,或某个复杂系统需要长期产品判断,而不是把 PM 当作每支工程团队的默认配置。Verrilli 看重的也不是单纯的利益相关者管理,而是候选人能否同时理解宏观系统和微观细节,快速验证假设,并在信息不完整时作出清晰决定。这个标准把 PM 的价值从「维持流程」转向「提高团队判断质量」。

访谈给出两项很实用的工作方法。其一是保留强 IC 路径,让资深产品人持续靠近实际问题,而不是只能通过扩大管理范围获得成长;其二是在实验启动前,同时写下成功和失败时可能出现的结果。后者迫使团队提前讨论指标的多种解释,避免数据出来后只挑选支持原假设的故事。AI 数据工具则可以加快群体分析和异常回归定位,但它仍不能替团队定义什么结果对用户和业务真正重要。

这种组织方式要求工程师与设计师承担更多产品责任,也要求创始人和领导者愿意共享足够上下文。若业务高度受监管、跨部门依赖密集,或团队成员缺少用户研究能力,减少 PM 可能只是把协调成本转移给其他人。反过来,如果 PM 的主要工作是排期、转述和主持会议,那么增加岗位也不会自动改善产品质量。判断是否需要 PM,最好从具体决策为何变慢、谁离客户太远、哪些责任无人承担开始。

来源:Lenny’s Podcast · BestBlogs 评分:92

★ 精讲三:176: 姚顺雨,来到腾讯 300 天

《晚点聊》把姚顺雨加入腾讯后的变化放回混元的发展史中观察。腾讯并非没有模型、人才和场景,而是长期存在多支团队、不同目标与资源分配机制:混元追求通用模型能力,微信 VLM 更贴近微信自身的隐私要求和产品规则,游戏等业务也有各自的模型探索。姚顺雨负责混元大模型与 AI Infra 后,报道认为团队重新聚焦,引入年轻研究者,调整关键岗位,并重建训练与研发体系;但节目也记录了老员工的不适应和新旧团队磨合。

图片

模型发布是这轮调整最容易被外部观察的结果。节目把混元 3 视作团队磨合和稳定节奏的一次交付,而不是已经完成追赶的证明;团队对后续版本的期待包括更大文本规模、多模态能力,以及继续优化刚重建的数据与基础设施。InfoWorld 的独立报道可确认,Hy3 预览版是腾讯招募姚顺雨后首个重要混元版本,但时间上的先后不能证明模型进步来自某一个人,更不能代替第三方基准和真实使用数据。

组织调整的另一面,是模型与产品的连接。节目提到腾讯内部计划建设可供不同业务使用的强化学习平台,先与 WorkBuddy、元宝等产品形成更紧密反馈,让产品数据进入后训练。这个方向比「统一所有模型」更现实:业务团队保留自己的场景和指标,混元提供训练能力与通用底座。按照节目采访时的进度,该平台仍准备进一步推进,尚未大规模铺开,所以更关键的问题是业务反馈能否被合法、准确地转成模型改进,而不只是部门之间增加新的接口。

微信与混元的关系尤其能说明边界。微信的 Agent 会按场景调用微信自有模型、DeepSeek 或混元,元宝则更多转向混元;双方会合作、也有人才流动,但节目判断微信 VLM 与混元大概率长期并存。微信面对全民级产品的隐私、稳定性与交互规则,不能只追求模型上限;混元则需要更广泛的训练和商业化场景。并存会带来资源竞争,却也避免一个统一模型强行承担差异巨大的产品约束。

姚顺雨公开表示 AI 是长期竞赛,并点名 coding Agent、多模态与具身智能仍有机会。节目进一步讨论,商业化可能从 coding 扩展到更广泛的知识工作,但腾讯是否能把社交、办公、内容和游戏场景转成高质量反馈,仍受部门边界、用户需求和执行效率制约。这篇复盘的价值,不在给改革提前盖章,而在提供一组后续观察指标:人才与研发体系能否稳定、平台能否形成产品闭环、模型发布能否获得独立验证,以及微信与混元的分工是否减少而非增加重复建设。

来源:晚点聊 LateTalk · BestBlogs 评分:91

速览

AWS 老兵:新的软件开发生命周期

在 AWS 工作 11 年的 Heitor Lessa 把 Agent 驱动的软件开发拆成从产品发现、规范、实现到合并检查的完整循环,并将这套工作流用于 1400 名工程师的组织场景。他强调,Agent 可以加速执行,但需求背景、验收标准和产品判断必须先被团队表达清楚。

他用一次重构消耗约 2 亿 Token 的经历说明,盲目让高端模型持续探索会迅速放大成本。更可控的做法是按任务选择模型,在探索阶段保留强推理,在实施和审查阶段使用合适成本的模型,并以命令、Hooks、条件审查员和自定义 lint 把质量约束写进循环。

这套方法的重点不是增加更多自动化步骤,而是让每一步都能被检查、停止和修正。团队可以先从一条高频变更链路试行,记录 Token 成本、返工率和缺陷,再决定哪些环节值得固化。

来源:跨国串门儿计划 · BestBlogs 评分:90

英伟达、斯坦福联合发布新工作:机器人上下文扩至 8K,意味着什么?

NVIDIA GEAR、Stanford 与 UT Austin 团队提出 RoboTTT,用 Fast Weights 让机器人策略处理最长 8,000 个时间步的视觉—动作上下文,目标是在跨越数分钟的任务中保存更长工作记忆。

图片

它并非把全部历史原样塞进注意力窗口,而是在测试时根据近期经历更新快速变化的参数,使策略能记住先前动作、识别偏差并从错误中恢复。实验关注的因此不只是首次成功率,也包括长序列中的恢复能力。

8K 上下文扩大了机器人可利用的历史,却没有消除计算开销、错误累积和真实环境分布变化。判断这类方案时,应同时看记忆长度、任务完成率、恢复质量与端侧延迟,而不能把时间步数量直接等同于可靠自主性。

来源:十字路口Crossing · BestBlogs 评分:89

何时终结「刷榜」顽疾:让 AI 基准回归真实人类价值

Nick Heiner 认为,公开 AI 基准一旦成为实验室优化目标,就可能从测量工具变成训练方向,分数持续上升,却与人类实际感受到的帮助、安全和可靠性逐渐脱节。

可信评测需要昂贵而细致的设计:避免题目泄漏,持续更新任务,由领域专家定义标准,并检查模型是否通过投机捷径得分。更重要的是,评测样本与评分规则要对应真实用户关心的结果,而不是只追求一个稳定、易比较的排行榜数字。

这意味着团队不能把单一榜单当作采购或发布依据。更稳妥的组合是公开基准用于横向筛选,私有任务集验证自己的场景,再用真实用户反馈检查评测是否仍在测量有意义的能力。

来源:AI Engineer · BestBlogs 评分:90

MCP Tasks:为何持久化异步工具依然棘手

Cornelia Davis 以发票处理为例说明,MCP Tasks 的难点并非让工具异步运行,而是让一个任务在客户端断连、服务重启、外部系统失败和人工审批后仍能恢复,并让调用者知道它当前处于什么状态。

一个可靠生命周期需要持久化任务标识、状态转换、结果与错误,区分安全重试和重复执行,并处理取消、超时与权限变化。涉及人工审批时,系统还要能暂停并在授权后继续,而不是让长连接承担全部状态。

因此,Tasks 更像一份分布式工作流契约,而不是异步函数语法。实现者应先定义状态机、幂等边界和恢复语义,再决定轮询、通知或队列等传输方式,否则「后台执行」只会把失败藏得更深。

来源:AI Engineer · BestBlogs 评分:90

微软、Meta 同日交财报:小扎把现金流烧到只剩 7.84 亿美元,纳德拉靠 Azure 赚疯了

微软与 Meta 同日发布财报,呈现两种 AI 投资回报节奏:微软通过 Azure 与 Copilot 把算力投入更直接地连接到云服务收入,Meta 的广告业务仍在增长,但大规模资本开支显著压低现金流。

两家公司都在增加 AI 基础设施投入,差别在于现有商业模式吸收成本的路径。微软可以按云资源和软件席位收费;Meta 更多依靠推荐与广告效率改善来间接回收投入,基础模型和新设备的回报周期也更长。

单季现金流不能判定长期战略成败,却能提醒投资者关注收入确认与资本开支之间的时间差。比较 AI 公司时,除了模型能力,还应看利用率、折旧、增量收入和主营业务是否能持续承担建设成本。

来源:InfoQ 中文 · BestBlogs 评分:88

GitHub AI Agent 翻车:攻击者不用黑客技术,只写一句话就能窃取数据

研究者展示了一类间接提示注入:攻击者在公开 GitHub Issue 中嵌入指令,当拥有更高权限的 AI Agent 读取 Issue 并执行工作流时,可能被诱导访问私有仓库信息并把数据带出。

漏洞机制利用的是「不可信文本」与「高权限工具」进入同一上下文。对 Agent 来说,用户需求、仓库内容和攻击指令都可能只是自然语言;若工作流缺少来源标记、最小权限和输出限制,模型无法可靠地仅凭语义区分哪条指令可以执行。

防护不能只靠提示词要求模型忽略恶意内容。团队需要隔离公开输入、限制令牌权限、为敏感读取与外发设置确定性策略,并把 Agent 生成的变更与网络请求纳入审计。

来源:InfoQ 中文 · BestBlogs 评分:89

「热爱一个行业 15 年的理由是什么?」|对谈汪天凡:我要投真正的快乐、投最纯的愿景、投人性的光辉【公路播客】

BAI 资本合伙人汪天凡回顾 15 年 VC 经历,认为 AI 时代的投资判断不能只靠覆盖热门项目:投资人既要形成自上而下的价值判断,也要亲自使用产品和模型,在一线验证概念。

他提出「智能会通胀,智慧仍稀缺」,并把智慧理解为智能加入反馈、经验、反思与个人 context 后形成的取舍。由此,他更关注能帮助用户反思、建立关系和活在当下的产品,而不只是把效率继续推高的工具。

这些观点带有明确的投资立场,也与其被投项目有关,不能直接当成市场规律。对创业者更有用的追问是:产品收集的 context 是否获得用户信任,交互是否改善真实生活,以及价值主张能否由留存和行为变化支持。

来源:十字路口Crossing · BestBlogs 评分:91

补充阅读

AdaMAST:自适应失败分类法,改进 LLM 智能体

AdaMAST 从目标 Agent 的执行轨迹中自动归纳失败代码,并沿固定维度组织成适应该系统的分类法,再用于 best-of-N 评估、运行时编码反馈和搜索优化。它把「失败了」细化成可定位、可比较的问题类型,但分类质量仍取决于轨迹覆盖与证据标注。

来源:Hacker News - Newest: “LLM” · BestBlogs 评分:90

什么是 Self-evolving / self-improving / RSI ?一篇文章搞懂自进化

文章把自进化按优化对象分为 Artifacts、Harness 与 Model:分别改进产出物、提示词与工具脚手架,以及模型参数本身。这个分类有助于区分今天已经常见的工作流迭代,与风险和难度更高的递归自我改进。

图片

来源:青稞AI · BestBlogs 评分:90

AI 来了,大厂中层不好混了

五位大厂中层的访谈显示,AI 正让信息汇总、任务拆解和进度跟踪更容易自动化,部分管理岗位面临收缩与考核重构。个体经历不能代表所有公司,但它提示中层价值需要从传递信息转向判断、协调复杂冲突和培养团队。

来源:人人都是产品经理 · BestBlogs 评分:88

不是所有产品都适合 AI 化:一个 AI 产品经理的判断框架

文章用四层框架检查一个场景是否值得 AI 化,重点考察问题是否需要模糊判断、数据是否可得、错误是否可承受,以及 AI 是否让用户流程更简单。它提醒团队先验证用户任务和失败成本,再决定接入模型。

来源:人人都是产品经理 · BestBlogs 评分:89

Android互操作性的重大胜利 – Open Home Foundation

欧盟委员会依据 DMA 的互操作要求,要求 Google 向第三方助手开放包括唤醒词检测与传感器访问在内的 11 项 Android 功能,并按平等条件提供。开放接口扩大了用户选择,但实际效果仍要看实现期限、权限边界和第三方能否获得稳定体验。

来源:Hacker News · BestBlogs 评分:87

关于 AI 发展的公开信

Simon Willison 汇总三封近期公开信,呈现围绕开放权重模型、蒸馏以及是否应放慢自动化 AI 发展的分歧。把这些文本并读,可以看见开放创新、安全外部性与权力集中之间没有简单共识。

来源:Simon Willison’s Weblog · BestBlogs 评分:88

知名搜索框架 Firecrawl 开源的 Web Agent。

Firecrawl 开源其用于深度网络研究的 Web Agent 框架,支持自主搜索、并行任务和模块化部署。开源降低了复杂网页自动化的实现门槛,采用者仍需自行约束抓取权限、来源引用与失败恢复。

图片

来源:逛逛GitHub · BestBlogs 评分:89

GitHub - pochenai/nano-llm-posttraining:在单张 8GB GPU 上进行的极简、可读的 LLM 后训练实验,度量遗忘、随机种子方差与 RL 涌现

nano-llm-posttraining 在单张 8GB GPU 上展示 SFT、DPO 与 GRPO 等后训练实验,并显式测量遗忘、随机种子差异和推理行为。它适合学习实验机制,但小模型与教学规模的结果不能直接外推到生产模型。

来源:Hacker News - Newest: “LLM” · BestBlogs 评分:88

只用一张卡,做出了声称是 100M 参数以内最好的小模型?

BarunLM-35M 用单张 H200 完成训练,并以局部与全局注意力混合架构参加九项零样本评测;作者报告平均准确率 41.01%。项目开放权重、代码和评测,但「100M 参数以内最好」仍应结合训练数据、基准污染和复现结果判断。

来源:机器之心 · BestBlogs 评分:87

在消费级硬件上测试 LLM 并发 — ai.2it.onl

一组在 RTX 5060 上完成的 19 个模型、456 次运行测试显示,并发可以显著提高总吞吐,MiniCPM5 1B 的峰值达到 983 tok/s;同时,一些模型受首 Token 延迟、隐藏推理和显存限制影响,规模扩大后体验反而变差。

来源:Hacker News - Newest: “LLM” · BestBlogs 评分:87

延伸探索

其余材料可以沿四组主题继续阅读:模型与平台包括 GPT-5.6 Luna 降价、OpenAI 开放平台转向、Astra 数学进展、DeepSeek V4 与 Kimi K3;工程实践覆盖 RAG 证据链、上下文压缩、Token 节省、Jotai Store 和 React Compiler 的 Rust 迁移;Agent 方向则连接网络安全基准、AI 同事、Claude Code 工作流与 Karpathy 的 Three.js 实验。

多模态与物理世界是另一组线索:MiniMax H3 与 Seedance 2.5 的多篇实测讨论生成能力和创作方法,日本机器人、Jeff Dean 的自进化 Agent 判断以及 LA 山火 3D 扫描把视野扩展到硬件、空间与真实环境。这些内容适合按具体兴趣探索,不必从标题中的强结论直接推断模型、产品或研究已经得到独立验证。

今日阅读路径

只有十分钟,先读 Igor Babuschkin 对「可验证领域」与 River AI 三项押注的拆解,建立模型路线判断;再读 Whatnot,检查自己的团队是否把 PM 当作默认中间层;最后读腾讯混元复盘,看组织调整如何落到模型发布、训练平台与业务反馈。如果还有时间,再补读 MCP Tasks 和 GitHub Agent 提示注入,它们分别对应可恢复性与权限安全。

建议按 River AI、Whatnot、腾讯混元的顺序阅读,并思考两个问题:你的团队当前最缺的是模型能力、反馈闭环,还是清晰的责任分配?哪些组织变化已经能由产品结果验证,哪些仍只是有待观察的路线选择?欢迎打开原文继续阅读,并在评论区分享你的判断与实践。

原文信息

原文地址:

  • 作者:BestBlogs(@hongming731),BestBlogs.dev 主理人,AI 驱动内容精选服务
  • 发布时间:2026-08-03
  • 来源:X Article

文章评论(10

雪知秋53 分钟前

这个观点很中肯,深有同感。

回复
南山客49 分钟前

收藏了,以后慢慢研究。

回复
南山客28 分钟前

这个比较实用,已转发给同事。

回复
逐光而行58 分钟前

很有价值的分享,感谢整理。

回复
雪影45 分钟前

实测过类似工具,作者说的基本属实。

回复
白向阳刚刚

这个观点很中肯,深有同感。

回复
雪知秋40 分钟前

写得挺用心的,支持一下。

回复
龙文博58 分钟前

讲解得很细致,新手也能看懂。

回复
逐光而行50 分钟前

点赞,必须点赞

回复
青柠微凉36 分钟前

实测过类似工具,作者说的基本属实。

回复