从零构建智能体评测排行榜:Wolfram Ravenwolf 的实战方法

📌 One-Sentence Summary
Wolfram Ravenwolf 现场搭建智能体评测流程,说明重复运行的稳定性、完整配置、成本和执行轨迹,比排行榜上的单一平均分更重要。
📝 Summary
Ravenwolf 在实操工作坊中,以 Terminal Bench 和 Harbor 为基础,组合隔离沙箱、智能体运行框架、固定版本的基准、推理服务及资源限制。他的 WolfBench 工具汇总重复运行的结果,分别展示每次都成功的稳定性、平均表现、最好和最差结果,以及至少成功一次的能力上限。评测对象是整套配置,而非孤立的模型名称;智能体版本、推理路由、提示词、超时、并发和沙箱都会改变结果。现场完成一个 Git 修复任务,只能证明该次试跑成功,不能代表完整基准成绩。仪表盘会排除不完整运行、导出数据,并将排行榜分数连接到 Weave 执行轨迹。检查轨迹还能解释反直觉现象,例如在固定时间预算下,更高的思考强度反而使编码智能体完成更少任务。最终选择还应考虑 token 消耗和总成本。工作坊给出可复用的评测与判读流程,但转录没有提供独立核验的跨配置对照结果。
💡 Main Points
评测完整的智能体配置,而非模型名称。
结果同时受数据集、模型服务端点、智能体版本、沙箱、提示词、工具和时间预算影响;任一变量变化,都意味着实验条件发生变化。
重复试验能揭示平均分掩盖的可靠性差异。
WolfBench 对比五次运行中稳定完成的任务比例、平均分、波动区间和至少成功一次的上限,区分稳定解决问题与偶然成功。
排行榜结论应保留运行工件和执行轨迹。
工作坊收集完整的 Harbor 运行结果,排除未完成的试验,导出数据,并用 Weave 轨迹追查失败原因,而非只看柱状图。
结合时间和成本约束解读得分。
单任务演示不能充当完整基准;讲者检查轨迹后发现,更长时间的思考可能耗尽固定预算,却没有转化为更多已完成任务。
💬 Key Quotes
一个分数远远不够,因为表现是一种分布,不是单个点。
只跑一次基准,就像抽签。
你排的不是模型本身。
执行轨迹就是证据。
📊 Article Meta
AI Screening: 90
Featured: Yes
Source: AI Engineer
Author: AI Engineer
Category: 人工智能
Language: 英文
Read Time: 40 min
Word Count: 9932
Tags:
AI 与智能应用 , 可观测性 , 开发者工具 , 命令行与终端 , Harness工程
Play Full Video
暂无评论,快来抢沙发~