我们测试了 13 个答案验证器。仅计字符的基线击败了其中 8 个。

山止川行AI 前沿📡 BestBlogs·AI高分精选⭐ 902026-09-20974 阅读💛 205 收藏
我们测试了 13 个答案验证器。仅计字符的基线击败了其中 8 个。

📌 One-Sentence Summary 在 2,018 个项目上对 13 个答案验证器进行的直接对比基准显示,简单的长度与格式基线击败了其中 8 个,而按 AUC 排名最高的系统并非在实践中最能帮助代理的。 📝 Summary 作者在一个共享的 2,018 项测试集上对十三个答案验证系统进行了评测,使用相同的标签和公开的评分代码,按领域汇总并报告配对自举区间。两项发现尤为突出。首先,仅使用答案长度和格式的基线模型达到了 0.7036 的 AUC,超过了十三个系统中的八个,表明许多验证器检测的是答案的形状而非正确性。其次,AUC 排名并不能预测代理的实用性:在 20%重试预算的重试门控实验中,排名第一的系统 ZTC(0.7364 AUC)将端到端准确率提升了 1.34 个百分点,而几乎相等的 Jev(0.7350)略微降低了准确率,因为重答仅修正了 38%的错误答案,却破坏了 30%的正确答案,导致门控精度而非召回率成为决定因素。文章还报告了更大模型在此维度并不更好,直接询问前沿模型的成本是中等水平的 23 倍,开放替代方案的速度声称成立,但在此数据集上的准确性声称不成立。 💡 Main Points 一个简单的长度与格式基线击败了大多数专门设计的验证器。 表面特征逻辑模型达到了 0.7036 AUC,超过了十三个系统中的八个。任何低于该阈值的验证器都在检测答案形状而非正确性,因此省略此基线的排行榜会让参赛者显得更好。 AUC 排名与代理实用性是不同的问题,答案不同。 ZTC 和 Jev 仅相差 0.0014 AUC,但在 20%重试预算下,ZTC 将端到端准确率提升了 1.34 个百分点,而 Jev 略微降低了准确率。你排名的指标并不是你部署的指标。 门控价值由精度而非召回率决定。 重答修正了 38%的错误答案,却破坏了 30%的正确答案,因此将已正确答案返回几乎是硬币抛掷。Jev 路由了 216 个已正确项目,而 ZTC 仅 195 个,21 个差异抹平了其优势。 更大的评判者在此维度并不更好。 同一系列中,397B 整体优于 27B,但在科学推理任务中,27B 的 0.7410 分高于 397B 的 0.6287。验证质量跟随表示几何而非参数数量。 直接询问前沿模型既昂贵又中等水平。 GPT-5.2 达到了 0.7148,低于两种打字决策配置,同时每 1,000 次调用约需$0.55,而 Jev 仅$0.024。像 GPT-4o-mini 和 Gemini 2.5 Flash-Lite 这样的较小评判者低于长度基线。 💬 Key Quotes 「A verifier under that line is not detecting correctness. It is detecting shape --- longer answers with more structure tend to be right, and you can learn that without understanding anything.」 「A leaderboard whose error bars only appear when someone else wins is not a leaderboard.」 「The two systems differ by 0.0014 AUC and by 1.4 points of end-to-end accuracy.」 「A gate's value is therefore set by precision, not recall.」 「Lowering a competitor's score on the strength of our own untrusted code is not a correction.」 📊 Article Meta AI Screening: 90 Source: DEV Community: machinelearning Author: ai maya Category: 人工智能 Language: 英文 Read Time: 6 min Word Count: 1425 Tags: AI 与智能应用 , AI 工程 , AI 工作流 , 模型路由 , 开源项目 Read Full Article

#AI 与智能应用# AI 工程# AI 工作流# 模型路由# 开源项目

文章评论(2

雪知秋48 分钟前

这篇文章分析得很透彻,收藏了!

回复
墨沐雨2 小时前

支持作者,持续关注中。

回复