600 美元的 PR:软件工厂的投资回报究竟来自哪里

📌 One-Sentence Summary
Tessl 研究负责人认为,软件工厂的投资回报主要来自任务上下文、贴近真实场景的验证、全流程成本核算和反馈闭环,而不只是更聪明的编码智能体。
📝 Summary
Tessl 研究负责人 Rob 介绍了一套内部软件工厂,公司约 80% 的 PR 通过这套流程处理,底层使用现成的编码智能体。一次 PR 花费约 600 美元,原因是修改智能体与审查智能体不断按指令往返,却没有停止条件,也缺少清晰的任务边界。他将软件工厂分为五个环节:选择有价值的任务、提供共享上下文和可用环境、执行任务、验证并交付,以及从结果中持续学习。案例说明,真正影响效果的是这些外围条件。团队为一个反复出现状态流转错误的持久化队列建立 Quint 形式化模型,遏止了这一小块关键组件的重复故障。另一项实验中,中等和高强度智能体的 CI 通过率相近,但高强度的首次审查通过率更高,算上后续审查可能反而更省钱。针对合并慢的问题,团队发现 CI 的 P90 耗时为 15.5 分钟,而合并队列达到 52.4 分钟,真正瓶颈并非最初提问所指向的 CI。Rob 主张同时计算 token、重试、审查、基础设施和人工注意力的成本,再把快速测试信号与后续返工、线上事故关联起来。他也承认,工程价值、客户结果和协作方式的收益仍难以精确量化。
💡 Main Points
智能体循环需要明确任务范围和停止条件
600 美元的 PR 来自修改智能体与审查智能体反复忠实执行指令;Tessl 将缺少范围和停止规则视为软件工厂的设计问题。
贴近真实场景的上下文和验证才能扩大委派规模
智能体需要组织决策资料和可运行的环境,但不真实的模拟数据可能让它认真验证错误目标,因此团队投入行为测试和与生产结果相连的证据。
小而关键的组件适合用形式化模型消除重复故障
面对持久化队列反复回归的错误,团队用 Quint 建模状态流转,以旧故障重放验证模型,再补充属性测试和不变量测试。
投资回报必须计入实现、审查和人工注意力的完整成本
中等强度编码运行的初始费用更低,首次审查通过率却低于高强度运行;只看 CI 成功和首轮 token 账单,会遗漏审查往返与返工。
反馈闭环应连接即时检查与后续生产结果
Tessl 抽取部分真实任务做影子实验,比较模型或上下文变化能否通过自动质量门禁,并尝试把智能体记录、审查过程与更晚出现的返工和事故关联起来。
💬 Key Quotes
有一天早上,我们发现一个 PR 烧掉了大约 600 美元,因为两个智能体都在严格执行我们的指令。
如果模拟数据不能代表真实情况,那智能体只是在非常认真地验证一个错误目标。
正是验证让这种委派变得可行。
成本不只是智能体本身,还必须计入人的注意力。
📊 Article Meta
AI Screening: 90
Featured: Yes
Source: AI Native Dev
Author: AI Native Dev
Category: 软件编程
Language: 英文
Read Time: 31 min
Word Count: 7569
Tags:
软件工厂 , 编码智能体 , 工程投资回报 , 形式化验证 , 代码审查
Play Full Video
实测过类似工具,作者说的基本属实。
点赞,必须点赞
点赞,必须点赞
支持作者,持续关注中。
不错不错,已加入书签。
有没有更详细的教程,期待后续。
整理得太全面了,省了我不少时间。
这个比较实用,已转发给同事。
路过
作者写得真不错,学到了不少。
讲解得很细致,新手也能看懂。
有没有更详细的教程,期待后续。