BestBlogs早报|Claude把深度推理带进语音,skill-up让Agent能力可回归,梁文锋内部交流

山止川行AI 前沿2026-09-17314 阅读💛 44 收藏

一句话结论

三条精讲同指一个提醒:能力演示之后,真正困难的是建立连续、可检验、受约束的工作系统——无论是语音推理的产品边界、Skill 的回归评测,还是持续学习的可验证证据。

导语

今天的三篇精讲分别落在交互、工程和公司路线三个尺度。

Claude 把 Opus 与 Sonnet 放进实时语音,让口头讨论从快速问答延伸到需要推敲的决策;阿里的 skill-up 则试图把 Agent Skill 从「跑起来了」推进到有用例、有证据、可回归;梁文锋的长篇交流给出 DeepSeek 对持续学习、算力、数据与开源的内部判断。

三者不必被拼成一条趋势,但都提醒我们:能力演示之后,真正困难的是如何建立连续、可检验、受约束的工作系统。

★ 精讲一:在语音模式下思考难题 | Anthropic 的 Claude

来源:Anthropic · BestBlogs 评分:90

Anthropic 这次更新的关键变化很具体:Claude 语音模式此前只运行强调速度的 Haiku,现在付费用户可以使用为复杂推理设计的 Opus 与 Sonnet,并在会话途中切换模型。语音模式会默认沿用最近一次文本聊天使用的模型,文本和语音之间也能承接上下文。它仍采用轮流对话——用户说完,Claude 停下来思考再回答——并不是持续打断式的实时共说,但这恰好给复杂讨论保留了推敲空间。

图片

Anthropic 给出的场景不是简单的语音输入:练习重要谈话并检查表达方式、检验客户提案的逻辑缺口、讨论产品路线并做竞争研究,或者为一次内容传播提出多种解释。共同点是,用户一开始往往只有半成形的想法,需要模型持续追问、复述假设和比较选项。对这类任务,语音的优势不在省去打字,而在降低「必须先把问题写清楚」的门槛,让思路在对话中逐渐成形。更强模型能否保持足够低的延迟,决定这种体验是自然的思考伙伴,还是一串令人分心的等待。

这里也要区分「更容易说出来」和「结论更可靠」。口语包含省略、改口和含混指代,模型若过早替用户补全意图,可能把一次探索式谈话带向错误方向。更适合的使用方式,是让 Claude 在关键节点复述当前假设、列出尚未确认的信息,并在执行前把决定转成可检查的文字。对于客户提案或职业选择这类高影响任务,语音可以帮助展开思路,证据核对仍应回到原始材料。

产品的第二层变化是从讨论走向执行。对话得出结论后,Claude 可以通过连接器推迟 Google Calendar 会议、把客户提案整理成 Canva 单页,或汇总邮件并起草回复;每次使用连接工具前都要请求许可。这个边界很重要:语音会让授权显得更轻松,但日历、邮件和文档都是有外部后果的系统,确认动作不能因为入口更自然就被弱化。免费计划可使用 Haiku、一个连接工具和新增语言,付费计划可访问更多模型与全部已连接工具;语音对话计入正常用量。

语言范围也扩大到英语、法语、德语、印地语、日语、韩语等多种语言,但 Claude 不会自动识别并切换语言,用户需要在语音设置中选择,或明确说出切换指令;此前的语言设置也不会自动继承到语音模式。因而这仍是一项 beta 产品更新,而非无摩擦的全双工助理。结合近期 BestBlogs 对 Claude 长时程任务和连接器安全的报道来看,Anthropic 正把「理解上下文—获得授权—调用工具」做成连续体验;现在值得观察的指标,是长对话的延迟、工具误操作率和授权提示能否始终清晰,而不只是模型名称是否更强。

迁移要点:语音深度推理的正确用法是「探索半成形想法」——让模型在关键节点复述假设、列未确认项,执行前把决定落成可检查文字;高影响决策的证据核对永远回到原始材料。

★ 精讲二:阿里开源 skill-up:让 Agent Skill 可评测可回归

来源:阿里 · BestBlogs 评分:91

图片

Agent Skill 的质量问题经常藏在「看起来还能用」之下:改动一段 SKILL.md 后,Agent 可能不再调用预期工具;同一提示换一个执行引擎,输出结构可能漂移;本地验证和 CI 又常由两套脚本拼起来,评测意图散落在命令与中间文件里。阿里开源的 skill-up 针对的正是这类回归风险,它用 evals/eval.yaml 和用例文件声明运行环境、Agent 引擎、输入、轮次、超时与判定方式,再由一条命令回放并生成结构化报告。

它的判断体系不是把所有结果都交给另一个模型打分。最便宜、最确定的检查放在第一层 expect:退出码、文件是否存在、回复是否包含或匹配指定内容,都可以直接验证。遇到结构化规则,再使用 rule;需要读取产物、执行定制逻辑时使用 script;只有语义质量无法由确定规则表达时,才调用 agent judge。这个顺序把成本和不确定性控制在必要范围内,也让失败证据更容易复现。对 Skill 工程来说,重要的不是「拥有一个 AI 评委」,而是先把能写成契约的行为全部写成契约。

skill-up 还支持多轮会话、跨引擎回放,以及对文件等产物进行断言。多轮能力可以检验澄清、执行、修正是否形成完整链路;跨引擎对比能暴露某项能力是否依赖特定 Agent 的隐式行为;产物级证据则避免只看最后一句回复。阿里在内部案例中把约 1200 行分散的编排代码收敛为本地与 CI 共用的声明式评测,让新增用例和定位失败不再需要理解整套脚本。这是案例结果,不等于任何 Skill 都会获得同样的代码缩减,但它说明评测语义从编排实现中抽离后,维护成本可以显著下降。

评测用例本身也需要版本治理。模型输出具有随机性,如果把整段自然语言逐字匹配,门禁会频繁误报;如果只检查退出码,又会放过语义退化。比较合理的分层是:副作用和文件结构使用确定性断言,关键业务规则用脚本检查,开放式质量再由 judge 评估,并保存输入、轨迹、产物与判定理由。跨模型升级时先在同一批用例上并跑,观察失败分布,而不是只比较一个平均分。

站内此前关于阿里智能分析 Skills 和 Harness 自主迭代的材料,讨论的是如何组织上下文、工具和执行循环;skill-up 补上的则是变更后如何证明行为没有悄悄退化。两者的边界需要保留:一套 Harness 可以让 Agent 更会做事,却不会自动告诉团队「什么算做好」;评测框架也只能验证已经写下的预期,无法替代对真实用户任务的选择。最稳妥的实践路径是从最昂贵、最常出错的 5 到 10 个任务开始,把输入、产物、允许的副作用和失败条件固化,再进入 CI;若先追求覆盖所有场景,评测本身也会成为难以维护的新系统。

迁移要点:Skill 评测分层走「expect(退出码/文件/包含)→ rule → script → agent judge」,确定性优先、语义兜底;先固化最贵最易错的 5-10 个任务,别贪全覆盖。

★ 精讲三:4 小时、118 个回答,梁文锋内部交流回应一切

来源:腾讯科技 · BestBlogs 评分:88

图片

腾讯科技整理的材料来自一场近 4 小时的投资者交流,共 118 条回答。报道同时称 DeepSeek 已完成首轮外部融资,募资总额超过 500 亿元人民币、投前估值约 3675 亿元,并列出梁文锋、腾讯、宁德时代等出资方。由于这些融资数字与会议内容来自媒体获得的交流材料,本文把它们作为腾讯科技的报道,而不是独立审计结果。更值得细读的是融资之后公司如何解释技术优先级、资源约束和开源策略,因为这些主张今后可以被产品发布与投入节奏检验。

梁文锋把 Agent 之后的下一道能力阶梯描述为持续学习:模型不仅在一次上下文中调用工具,还要从新的经验中更新能力。但他也承认,算力与高质量数据标注仍是主要约束。这个表述的价值在于把愿景与瓶颈放在同一张路线图里。持续学习不是把更多会话无差别写入记忆;它需要区分短期上下文、可检索记忆与真正的参数更新,还要处理错误经验污染、用户隐私、灾难性遗忘和评测基线漂移。若后续发布只增加记忆长度而没有可验证的学习机制,就不能视为路线兑现。

判断持续学习是否取得实质进展,可以看三类证据。第一,模型能否从新任务获得能力,同时保持旧任务表现;第二,新经验的来源、筛选和撤回是否可追踪;第三,更新成本是否低到足以持续发生,而不是每次都重新做大规模训练。公司若公开时间跨度更长的评测、学习曲线和失败案例,会比单一演示更能说明问题。反之,只有「记住了用户偏好」并不足以证明模型学会了新的通用能力。

交流中的另一组判断涉及开源和商业化。梁文锋强调「克制」与愿景驱动,认为开源和不急于争夺用户利益有助于提高实现 AGI 的概率;同时他又表示公司一直存在 C 端用户和 B 端收入,并非完全不做商业化。这里存在值得持续观察的张力:大额融资会带来算力采购、人才与回报要求,而开放权重会让生态更容易采用,也可能削弱单一产品的锁定。创始人的叙述提供方向,但不能代替经营数据;真正的证据会来自模型开放范围、许可证、推理价格、企业收入以及资本支出如何变化。

他对国产芯片、竞争格局和组织方式的评论也应被视为公司立场,而非行业共识。站内近期一篇关于模型、算力和具身智能的投资人判断,可以作为对照:资本侧更关心供应链、成本曲线和兑现窗口,创始人则强调长期技术概率。把两种视角并置,读者更容易发现需要验证的变量——持续学习是否出现可复现实验,算力短缺是否通过算法或供应改善得到缓解,开源是否持续产生外部开发者回流,以及「无 KPI 的愿景驱动」在组织扩大后能否维持。118 条回答信息量很大,但判断公司路线,仍应以之后可观察的行为而不是表达力度为准。

迁移要点:判断「持续学习」宣传的真伪看三证据——新任务能力获取且旧任务不掉、经验来源可追踪可撤回、更新成本可持续;只有「记住偏好」不算数。

速览

复杂业务场景下 RCA Agent 的探索实践

来源:快手 · BestBlogs 评分:88

快手把业务排障拆成四个难点:理解业务语义、过滤可能超过 75% 的告警噪声、量化诊断不确定性,以及抑制模型在数值和趋势上的幻觉。案例中,Feed 请求量上涨的表象最终追到推荐质量下降和跨服务配置变化,说明业务故障不能只靠单一指标或固定 Workflow。

文章给出的 Multi-Agent 与自进化路线,价值在于让诊断过程同时保留业务上下文、证据和不确定性,而不是让模型直接猜根因。落地时应先记录 Agent 引用了哪些指标和变更,再衡量根因命中率与误导成本。

Notion 如何摆脱 Token 困境

来源:Notion · BestBlogs 评分:87

Notion AI 工程负责人 Sarah Sachs 把 Token 成本视为产品架构风险:复杂分析可以使用前沿模型,收件箱分类或确定性转换则不应按同一价格执行。她建议建立共享的系统记录,按任务复杂度路由模型,保留供应商与开放权重模型的可选性,并用沙箱、可见性和受控持久化约束智能体。

判断 AI 功能是否健康,不只看单次调用价格,还要看每项能力每秒成本、延迟和工具失败率。模型可选性也不是换一个 API 名称那么简单:提示、工具参数和输出结构可能暗含供应商特性,因此路由层需要共享任务契约与持续评测。

图片

用于生产环境安全运营的多智能体 AI:5G 核心网中的 A2A 与 MCP 架构

来源:Capgemini · BestBlogs 评分:87

这套 5G 核心网安全架构先用 Isolation Forest 过滤常规遥测,只把新颖异常交给 LLM;窄职责 Agent 通过 A2A 协作、经 MCP 读取环境,所有外部动作再由 OPA 策略和 Kyverno 准入约束。作者报告 MTTD 与 MTTR 各降低约 40%,但明确这些数字来自单一运营商内部基线。

文中把结果分成自动执行、自动拒绝和升级人工三种终态,并为敏感资产、爆炸半径、置信度和可逆性分别设规则。更可迁移的原则是:高风险系统先构建 reviewer 和人工升级路径,再谈自动执行。

图片

GitHub 上 AI 智能体 Pull Request 的频率、结构与合并冲突率

来源:GitHub · BestBlogs 评分:86

这项研究把 AI Coding 的讨论从产码速度移到并发协作:它测量 GitHub 上智能体提交 PR 时,同一智能体与不同智能体任务之间的重叠和冲突特征。对团队而言,风险不只是单个 PR 写错,而是多个 Agent 同时修改相邻文件、基于不同仓库状态行动。

采用多 Agent 前,应把分支隔离、所有权划分、合并顺序和冲突率纳入吞吐指标。更高的 PR 数量若同时拉长等待审查与返工时间,交付周期并不会缩短;团队应把从任务创建到合并后的总时间作为结果指标。

Andrew Ng 宣布推出 OpenWorker:一个能够交付完成工作的开源 AI 智能体

来源:DeepLearning.AI · BestBlogs 评分:86

Andrew Ng 与 Rohit Prasad 推出的 OpenWorker 主打跨文件和日常工具交付成品:生成文档、发送 Slack 消息、更新日历,并支持 OpenAI、Anthropic、Google、开放权重模型和本地 Ollama。项目强调数据默认留在本地,除非用户明确选择外部提供商。

开放与模型无关降低了锁定,但涉及消息和日历时,权限范围、操作预览与失败回滚才决定它是否能成为可靠同事。下一步应观察项目是否提供细粒度授权、可重放轨迹和跨模型一致性测试,而不只看它能连接多少应用。

AI 数据可观测性:为何智能体会出错

来源:VentureBeat · BestBlogs 评分:87

智能体在上线数月后自信答错,原因可能不是模型或提示变差,而是价格、政策、规格已经更新,知识库仍在提供旧文档。传统管道通常检查数据是否可取和相关,却不检查内容是否仍然正确。

这类故障的危险在于监控面板可能全部为绿色:索引更新成功、检索有结果、模型也正常响应。治理需要把事实所有者和刷新时限写入数据契约,并用抽样核验检查高影响答案,把「检索成功但事实过期」视为独立故障类型。

图片

AI 实验室在「鹈鹕骑车」上刷榜了吗?

来源:Dylan Castillo · BestBlogs 评分:85

Dylan Castillo 用 8 种动物乘 6 种交通工具构成 48 条提示,在 7 个模型上各运行 3 次,并借助两个模型辅助评价,检查实验室是否特别训练了「鹈鹕骑自行车」图像。结果没有发现刻意刷这一趣味基准的证据。

这个实验的启发不是为模型排名,而是用对照组、重复采样和透明结果替代凭几张示例图形成的阴谋推断。这类小基准也提醒我们,可复述的轶事不等于可推广的证据;公开完整矩阵让读者能够检查替代解释,结论也更能经受复查。

图片

补充阅读

  • 感知智能体:让电脑操作更可靠的共享上下文闭环:Antje Barth 认为电脑操作 Agent 的瓶颈是跨系统完成任务后还能确认结果,提出共享渲染上下文并持续执行感知、规划、行动、验证闭环。
  • LLM 知识图谱为何必须保留可追溯的来源链:以医疗中的「患者对青霉素过敏」为例,静态来源 ID 无法解释合并、更新或删除后的事实,知识图谱需保存来源、可信度、变更与删除传播关系。
  • 测开的困局与突破:AI 让迟到已久的理想有了可能:京东技术把问题从「AI 会不会替代测开」改写为「测开本应创造什么价值」,把业务规则、历史缺陷和风险判断沉淀为框架与门禁。
  • 小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施:把大规模 ANNS 从高成本 DRAM 迁移到 NVMe SSD,小红书称硬件成本节省超过 90%。
  • 一文讲透 Agent 三件套:MCP、Skill、Hook 如何给大模型装上护栏:MCP 暴露工具、资源和提示,Skill 编排业务流程,Hook 在工具或脚本执行前后拦截高风险参数并记录审计。
  • AWS 老兵的智能体工程蓝图:从规格到验证的交付闭环:由人探索需求、写清规格、让 Agent 执行、再用测试和业务语境验证结论,团队才能保留对系统的理解与责任。

今日阅读路径

如果只有 15 分钟,先读 Claude,理解语音如何从输入方式变成「讨论—授权—执行」的产品链;再读 skill-up,看看怎样把 Agent 行为写成可回归证据;最后读梁文锋交流,区分公司路线、资源约束与仍待验证的创始人判断。若你负责生产系统,可把 5G 安全架构和数据可观测性接在后面,分别检查动作边界与知识时效。

阅读时不妨思考两个问题:你的 Agent 系统里,哪些行为已经能被确定性契约验证,哪些仍依赖主观观感?当模型开始代表用户调用外部工具时,授权、数据新鲜度和回滚分别由谁负责?

原文信息

原文地址:

  • 作者:BestBlogs(@hongming731),BestBlogs.dev 主理人,AI 驱动内容精选服务
  • 发布时间:2026-07-23
  • 来源:X Article

文章评论(9

雪影39 分钟前

内容翔实,正好需要,先收藏再看。

回复
北岛渔夫3 分钟前

讲解得很细致,新手也能看懂。

回复
雪知秋42 分钟前

收藏了,以后慢慢研究。

回复
星观澜5 分钟前

整理得太全面了,省了我不少时间。

回复
南山客16 分钟前

讲解得很细致,新手也能看懂。

回复
墨沐雨18 分钟前

楼主辛苦了,内容很有参考价值。

回复
空向阳13 分钟前

支持作者,持续关注中。

回复
白向阳33 分钟前

这篇文章分析得很透彻,收藏了!

回复
雪影36 分钟前

很有价值的分享,感谢整理。

回复