BestBlogs早报·07-28|Claude Code用消融与验收维护Agent,Kimi K3重构推理训练栈,AI网关集中治理

清风徐来AI 前沿2026-09-171181 阅读💛 29 收藏

一句话结论

三条精讲同指一个动作:模型变了,你的维护方式必须跟着变——提示词按消融实验管理,推理系统按状态生命周期重做,治理按变化最快的那层集中。

导语

模型更新带来的问题,常常不会停在模型层。旧提示词可能从补偿变成限制,新注意力架构可能让成熟缓存失效,更多团队接入 Agent 后,分散在应用里的路由、安全和审计也会迅速变成治理负担。

今天三条精讲按实践路径展开:先看 Claude Code 团队如何删除旧脚手架、用困难任务验证真实需要;再拆解 Kimi K3 为什么迫使推理与训练系统重做状态管理;最后评估 AI 网关何时能成为吸收变化的架构接缝,以及何时反而会增加不必要的集中化成本。

这条路径关注的不是三个孤立产品,而是变化怎样穿过产品行为、运行时状态和组织责任。读完后,读者应当能为自己的系统找到一个下一步可验证的问题,而不是只记住一组新名词。

★ 精讲一:Boris Cherny 谈如何打造 Claude Code:提示词消融、验证闭环与智能体工作流

来源:Y Combinator · BestBlogs 评分:92

图片

Claude Code 创建者在 Y Combinator 的完整访谈里,给出了一套很具体的 Harness 维护方法:每次新模型发布,先删除系统提示、工具提示和已有行为约束,再用真实任务测量哪些内容仍然必要。团队曾删除大约百分之八十的系统提示。这里的结论并不是提示越短越好,而是旧规则往往是在补偿旧模型的稳定失败;模型能力变化后,未经复测的补偿可能限制新的能力。

这让提示词维护更像消融实验。团队先运行困难任务,观察失败是否重复发生,只在证据明确时补充上下文、工具或指令。每条规则都应该能回答三个问题:它对应什么失败,什么任务可以复现,未来满足什么条件可以删除。与不断累积「最佳实践」相比,这种方法更慢,却能避免系统提示逐渐变成没人敢动、也没人知道原因的历史层。

访谈把结果验证放在提示技巧之前。一个例子是让 Agent 把 Electron 桌面应用改写为 Swift,在 Mac 虚拟机里运行,并用截图逐像素比较界面。Agent 能观察中间结果,识别偏差,再继续修改。评测对象因此不只是一次生成是否正确,还包括长任务里能否保存进度、检查结果、发现跑偏并恢复。若没有可观察的结果,再精巧的长提示也难形成可靠闭环。

动态工作流则把这种闭环扩展到多个阶段:一组 Agent 并行探索,另一组验证,最后再合并结果;例行任务可以持续寻找死代码、清理结束的实验、补测试覆盖和统一重复抽象。作者也明确保留边界,复杂系统工程与精细 UI 验证仍然困难,多 Agent 数量与生产力的现场估计不能直接外推。更稳妥的起点,是挑一个验收条件明确的长任务,删除一条历史规则,记录失败是否真实增加。

迁移要点:新模型发布后先删后测,把每条系统提示规则挂上「对应失败—复现任务—删除条件」三问;长任务先搭可观察的验收(虚拟机运行+截图比对),再谈提示词优化。

★ 精讲二:Kimi K3 上线即获 SGLang 推理与 Miles 训练支持

来源:月之暗面工程博客 · BestBlogs 评分:93

图片

Kimi K3 有两万八千亿参数,由六十九层 KDA 线性注意力与二十四层 MLA 交错组成,并引入 LatentMoE 和 Attention Residuals。规模本身不是这篇工程文章最有价值的部分。真正的难点是混合架构改变了服务系统对状态的基本假设:MLA 的 KV 随 token 追加,KDA 的循环状态却会在每一步原地覆盖。

追加式 KV 可以共享前缀、保存到树上并按 token 分页;会被覆盖的状态不能任意切片,也不能在推测解码失败后简单释放新槽位。SGLang 因此重新设计状态生命周期:运行请求使用工作槽,检查点只在分块边界稀疏保存,并在共享前缀树中复用;分支请求从最近检查点重放到新的分叉位置。恢复和快照都进入串行前向流,避免在热路径使用全设备同步。

两类状态的分配单位还相差三个数量级。文章在张量并行为八的设置下,给出的 KDA 状态块约为五十四 MB,单 token 的 MLA KV 块约为二十七 KB。若启动时固定划分两个池,一侧可能耗尽,另一侧仍有大量空闲。统一内存让 KDA 与 MLA 从同一片空间的两端分配,中间保持连续空闲区,使容量跟随短请求与长上下文的实际比例变化。

推测解码中的 ReplaySSM 更能体现「保存必要信息,而非照搬旧状态」的思路。传统方案为每个草稿步骤保存完整状态快照,文章给出的草稿窗口为五百一十二 KB。ReplaySSM 只保存原始输入,采样器确定接受长度后,再从已提交检查点重放被接受的前缀,窗口降至十六 KB,约缩小三十二倍。重放使用与验证相同的递推、分块、归约顺序和门控值,保证状态一致;它提升的是并发容量,并不声称单步计算更快。

团队还报告,在指定配置下,批量为一的推测解码约每秒四百二十三个 token;Miles 在原生 MXFP4 检查点上完成十二小时 LoRA 强化学习,AIME 二零二四从百分之四十三点三升至百分之七十六点七。这些数字都绑定 GB300、批量、上下文与训练配置,适合解释机制,不能直接拿来比较产品速度。接入新模型时,团队更应核查状态能否恢复、缓存能否共享、推测结果如何提交、不同负载怎样争用内存,以及训练与推理是否使用一致的数值路径。

迁移要点:接入混合架构模型前,按「状态可恢复、缓存可共享、推测提交路径、内存争用」四项核查推理栈;训练侧确认数值路径与推理一致再比较成绩。

★ 精讲三:管理 AI 变化速度的进化架构模式

来源:InfoQ · BestBlogs 评分:89

图片

InfoQ 这篇文章把企业 AI 集成首先定义为一个进化架构问题:模型、协议、工具与失败模式变化得比核心业务系统快,团队需要决定把变化放在哪里。传统 API 网关已经处理身份验证、限流与路由,但 Agent 系统打破了三个前提。相同输入可能产生不同决策路径;请求在协议上完全正确,语义上却可能执行了错误动作;客户端也不再事先确定完整动作,而是让 Agent 根据目标选择工具。

作者提出将 AI 网关作为共享控制层,集中模型路由、Agent 身份、逐动作策略、内容防护和语义审计。模型路由吸收供应商切换、成本和故障转移;身份保留 Agent 代表谁行动;逐动作策略在每次调用前重新判断权限,即使令牌有效,也不自动放行被提示注入劫持后的危险动作;内容防护检查输入注入与输出泄露。

审计也需要从「调用发生过」升级为请求、决策、动作之间的语义记录。一个代码审查 Agent 可以读取仓库、发表评论与运行扫描,但明确禁止推送代码、合并变更和读取密钥。策略以版本化配置管理,经过评审后独立发布。这样,安全团队可以负责规则,平台团队负责网关,业务应用不必为每次规则变化重复改造。

文章没有把集中化写成默认答案。每一项检查都会增加延迟和吞吐压力,网关本身需要清晰的所有者和运维预算,内容防护仍会产生误报与漏报,统一接口也可能延后供应商新能力。应用内部还可能拥有网关看不到的业务语境,部分授权必须留在应用侧。单团队、单模型或高度延迟敏感的系统,应用内控制也许更合适。

决定是否引入这一层之前,可以先画出一次 Agent 动作经过的身份、路由、策略和审计链路,列出变化最快的规则、必须保留的决策证据和可接受延迟。若共享层能减少多团队重复实现,并且责任人明确,它可能成为有效接缝;若现有 API 治理尚未稳定,新网关也可能只是把分散问题集中成新的单点。

迁移要点:先画一条 Agent 动作的治理链路图,列出变化最快的规则与必须保留的决策证据;单团队/高延迟敏感场景慎上集中网关。

速览

DeepSWE:抗污染的代码智能体评测基准

来源:DataCurve · BestBlogs 评分:87

DataCurve 介绍 DeepSWE,使用原创、经过行为验证的长周期任务,降低代码 Agent 评测中的数据污染与奖励投机风险。

题目新颖只是起点,任务还要暴露真实的多步工程能力,评分应奖励目标完成,而非容易伪造的表面信号。长周期任务也更容易观察 Agent 是否会规划、使用工具、检查结果并从失败中恢复,而不是只比较最终补丁的文本相似度。

这套思路适合评测设计者检查两个风险:题目是否已经进入训练语料,奖励函数是否允许绕过真实目标。

Agent 开始「自我进化」:会出题、会反思,还会自己长出新技能

来源:量子位 · BestBlogs 评分:88

文章把自进化 Agent 分成经验存储型、强化学习训练型和零数据自学型三条路线,区分经验究竟写进外部记忆、模型权重,还是连训练任务也由系统生成。

经验存储型通常保留模型本身,通过动态增删 Skill 或记忆更新行为;强化学习路线把反馈写入权重;零数据路线进一步让 Agent 自己出题、互相评估。这个分类比「会反思」更有判断力,因为三条路线的成本、可逆性与验证方式都不同。

选择路线时,还应确认错误经验能否撤销、训练反馈是否稳定,以及自生成任务会不会逐渐偏离真实需求。

图片

AI 如何正在扩展人们的工作内容

来源:OpenAI · BestBlogs 评分:86

OpenAI 分析美国 ChatGPT 用户超过八十万条消息后发现,工作相关消息中百分之十六点八涉及其他职业任务;明确对应职业的消息里,这一比例为百分之四十三点五。

研究称之为「任务交叉」:小企业主可以自己起草文案、检查合同或做基础财务分析,销售人员也可能直接探索客户数据。AI 的影响不只体现为同一岗位提效,也可能改变谁来完成原本属于其他职业的任务。

这些数据描述的是消息中的任务分布,不能直接证明岗位已经被重新定义,却为观察工作内容如何变化提供了可持续跟踪的指标。

图片

蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash

来源:蚂蚁集团 · BestBlogs 评分:84

Ling 3.0 Flash 总参数一千二百四十亿,单次激活五十一亿,采用 KDA 与 MLA 混合注意力,并针对 Agent 的长程规划与纠错训练。

模型以五比一交替堆叠 KDA 和 MLA,并把每个 token 的专家激活比例进一步压缩。发布材料还给出超过一万个真实交互训练环境,以及长输入首字延迟降低百分之六十到八十以上等结果。

这些比较主要来自发布方,并包含特定工程优化,仍需在相同任务、上下文和服务配置下独立评测确认。

阿里最新发布,千问 AI 平台 Token Plan 实测来了!

来源:阿里云 · BestBlogs 评分:86

千问 AI 平台用统一 API 接入一百多个系列模型,并开源两个 Skill,让 Agent 可以自行选择和调度模型。

文章实测把一段故事拆成三幕分镜、三张关键帧、三段图生视频和三句旁白,跨文本、图像、视频与语音模型完成一条十五秒短片。调用日志还能记录请求来自哪个 Skill、用了什么模型以及运行状态。

值得观察的是,模型选择正从人工配置变成 Agent 可执行、可记录的工作步骤;代价和失败处理是否同样可控,将决定它能否进入长期工作流。

图片

NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式模拟

来源:NVIDIA · BestBlogs 评分:84

Cosmos H Dreams 将世界基础模型蒸馏为面向手术机器人的实时生成式模拟器,用来训练和评估策略。

实时交互让机器人策略可以更快获得反馈,研究者也能在低风险环境中重复测试稀有或危险情境。它提供的是产生交互数据、检查策略边界的补充环境,并不替代真实设备与临床条件下的验证。

评估时需要区分模拟器的生成质量、物理一致性和策略迁移效果,避免把画面逼真直接等同于训练有效。

百亿补贴 C 端 AI Coding 实战:基于 SDD 的服务端 AI Coding 实践

来源:大淘宝技术 · BestBlogs 评分:88

淘宝团队复盘百亿补贴项目如何结合规格驱动开发与自进化记忆,在复杂服务端场景中实现案例所称的零手写代码交付。

规格驱动开发先把需求与约束写成机器可消费的边界,自进化记忆再沉淀项目里的规则、失败和修复经验,使后续生成能复用已有判断。

比自动生成比例更值得看的,是规格怎样约束生成、记忆怎样积累,以及复杂业务规则最终由什么机制验证。案例能否迁移,也取决于测试、评审与线上观测是否覆盖了真实风险。

补充阅读

  • 空间智能新作,影石开源户外全景重建算法:PanoLOG 把全景三维重建的分区依据从空间可见性转为梯度贡献,以缓解户外大场景的采集与计算瓶颈;对需要处理连续全景采集的大场景团队,这提供了新的任务切分依据,但重建质量与计算收益仍要在不同地形和采集密度下复核。
  • 顶会入选|COVERT——面向视觉语言模型的隐私保护推理框架入选 ECCV 2026:通过视觉管线重参数化与定制调优,在视觉语言模型服务中同时考虑隐私、效果与推理效率,适合关注多模态输入暴露风险的团队继续核查其威胁模型和部署成本。
  • AI 最尴尬的短板,中国科学院出手了:团队提出 SoMBench、Zing 和 Actio,把 Agent 理解意图与社会情境的能力拆成可测量、可训练、可部署的工程环节;值得继续追问的是评测情境是否覆盖文化差异,以及训练后的提升能否迁移到开放环境。
  • 下一代搜索智能体评测基准!美团开源 LoHoSearch:利用知识图谱自动出题,为搜索 Agent 构造更长程、更有区分度且关系可核对的评测任务,更关注跨多步检索、证据组合和最终校准,而不是单次搜索是否命中关键词。
  • 本周 TOP 17 排名的 GitHub 开源项目大盘点:榜单热度不能代表生产成熟度,浏览时先按需求筛出两三个候选,再检查最近发布、开放问题响应、依赖安全与文档中的已知限制。
  • 技术与叙事:一部关于狂热者与反思者的历史:追溯蒸汽、电力、互联网与 AI 四轮技术叙事,帮助读者识别承诺、利益与风险讨论中反复出现的结构,区分可验证的能力进展、尚未兑现的社会收益和被忽略的分配问题。
  • 提升模型性能的六种智能体框架能力:NVIDIA Labs 推出开源框架 NOOA,把 Agent 表达为 Python 对象,面向对象的表达让状态、方法与组合关系更接近普通软件结构,便于复用熟悉的测试和封装方式。
  • 超越 RAG:AWS 上面向企业 AI 的任务感知知识压缩:TAKC 将完整知识库压缩成面向当前任务的摘要,关键判断是哪些信息对当前问题有用,以及压缩后是否仍保留跨文档关系。
  • 数据的现状:为何真实工作流正成为 AI 最稀缺的投入:模型更需要的是可验证的真实专业工作流证据,包括任务如何开始、专业人员怎样判断中间结果、什么条件代表完成,以及错误如何被发现。
  • ast-grep 如何使用 Rust 重写 Tree-sitter 并提高 30% 速度:借助 AI 将 Tree-sitter 的 C 解析器用 Rust 重写并报告解析速度提升约百分之三十,提供了一个检验 AI 重写与性能回归的方法案例,可信度来自完整测试与可重复基准。

今日阅读路径

时间有限时,先读 Claude Code 访谈,把提示词维护转成「消融、困难任务、可观察结果」的验证循环;再读 Kimi K3,理解新模型架构如何把变化传导到状态、缓存与训练;最后用 AI 网关文章检查团队的身份、动作策略、审计与延迟究竟应该由谁负责。

如果你正在做 Agent 产品,今天可以先建立一张最小验证表:任务目标、可观察结果、重复失败、现有提示、删除后的基线。它能把「感觉模型需要」变成下一轮可复查的实验记录。基础设施团队则可以从一个请求出发,把循环状态、缓存、推测提交与内存争用画成生命周期,而不是先追逐单点吞吐数字。

这里有四个具体思考问题:每条历史提示对应什么可复现失败?Agent 又能通过什么证据判断任务完成?哪些规则变化快到值得集中治理?哪些判断必须保留在拥有业务语境的应用里?

原文信息

原文地址:

  • 作者:BestBlogs(@hongming731),BestBlogs.dev 主理人,AI 驱动内容精选服务
  • 发布时间:2026-07-27
  • 来源:X Article

文章评论(6

龙文博55 分钟前

看标题就点进来了,内容果然没让人失望。

回复
漾漾其华49 分钟前

这个观点很中肯,深有同感。

回复
南山客46 分钟前

赞同,实践出真知。

回复
吴超8 分钟前

这篇文章分析得很透彻,收藏了!

回复
风倚栏30 分钟前

看完了,收获满满,期待更多更新。

回复
龙文博4 分钟前

这个观点很中肯,深有同感。

回复