哪个 LLM 答案验证器最准确?13 个系统,一个测试集,公开标签。

📌 One-Sentence Summary 文章在共享的 2,018 条测试集上对 13 个 LLM 答案验证器进行基准测试,发现 ZTC(397B)与 JEV 在准确率上统计并列第一(约 0.736),并揭示了各领域差异、开源替代方案、成本及方法论严谨性。 📝 Summary 文章介绍了一个统一的基准测试,包含横跨五个领域的 2,018 个问答对,使用 AUC 衡量验证器区分正确与错误回答的能力。文中详述了测试集构成、五个领域、按领域聚合,以及两项影响报告分数的关键方法论选择。排行榜显示 ZTC(397B)与 JEV 以约 0.736 并列,其中 JEV 在科学推理上表现突出,ZTC 在专业考试上领先。开源方案如 open-jev(4B)和 Laya 表现欠佳,而成本分析表明商业验证器远比调用大型 LLM 便宜。文章还指出了可复现性问题,列出了无法运行的系统,并观察到更大的模型并不保证更高的验证准确率,397B 在某些领域不如 27B 便是例证。实用建议包括使用简单的长度与格式基线作为合理性检查,以及在领域重要时阅读按领域的表格而非总体排名。 💡 Main Points 统一的基准设计与方法论 描述了 2,018 条测试集、五个领域、AUC 指标、按领域聚合,以及两项防止分数虚高的方法论选择。 顶尖表现者与统计并列 确认 ZTC(397B)与 JEV 为最准确(约 0.736),指出差距在统计上不显著,并强调领域特定优势,如 JEV 在科学推理上的领先。 开源替代方案与成本洞察 将开源验证器(open-jev 4B、Laya)与商业方案对比,提供每次调用成本数据,并表明自托管方案远比大型 LLM 推理便宜。 可复现性警告与规模对性能的洞察 列出无法运行的系统,标记待定条目,并观察到更大的参数量并不保证更好的验证准确率,397B 在某些领域不如 27B 便是例证。 💬 Key Quotes 简短回答:ZTC(397B)以 0.7364、JEV 以 0.7350 成为测得最准确的两个答案验证器,且两者之间的差距在统计上无法区分。 这个类别中的每家厂商都发布一个基准并赢得它。这个榜单之所以存在,是因为那些基准没有一个共享测试集。 两项方法论选择改变了数字的含义,所以它们应该放在这里,而不是附录里。 第一名和第二名并列,榜单如实说明了这一点 更大并不更好。在同一家族内,397B 在该领域比 27B 低 0.11——一个大了十四倍的模型,差了十一个点。 📊 Article Meta AI Screening: 87 Source: DEV Community: machinelearning Author: ai maya Category: 人工智能 Language: 英文 Read Time: 6 min Word Count: 1352 Tags: AI 与智能应用 , 测试与质量 , AI 工程 , 模型训练与推理 , 模型评测与基准 Read Full Article
有没有更详细的教程,期待后续。
这个比较实用,已转发给同事。