Cloudflare 刚发布两款决策模型。我在 OpenRouter 上让它们与 Jev 竞速

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-10-08407 阅读💛 82 收藏
Cloudflare 刚发布两款决策模型。我在 OpenRouter 上让它们与 Jev 竞速

📌 One-Sentence Summary

一项在 OpenRouter 上进行的实测对比显示,尽管 Cloudflare 新推出的 Clef 决策模型与 Jev 准确率相当,但 Clef 存在显著更高的延迟、增加的成本以及校准不佳的置信度分数。

📝 Summary

本文评估了 Cloudflare 最新发布的开源决策模型 Clef (27B) 和 Clef-flash (9B),并与成熟的 Jev 模型进行对比。虽然 Cloudflare 声称其具有更快的速度和更好的校准效果,但通过 OpenRouter 进行的独立测试表明,Clef 始终比 Jev 慢(1.7–3.4 倍),且单次调用成本更高。尽管两个模型在意图分类和段落检索任务上的准确率相似,但 Clef 的置信度分数无法区分正确和错误的答案,导致其在下游逻辑中不可靠。Clef-flash 在速度和价格上表现更好,但在近似实体消歧场景中表现挣扎。作者得出结论:尽管 Clef 拥有开放权重和多模态能力,但对于需要可靠置信度指标和高成本效益的生产应用而言,Jev 仍是更优选择。

💡 Main Points

宣称性能与现实之间的差距

Cloudflare 基于内部硬件测试声称 Clef 比 Jev 更快。然而,通过 OpenRouter 进行的真实世界基准测试显示,在各种任务规模下,Clef 比 Jev 慢 1.7–3.4 倍,这凸显了厂商控制指标与用户体验到的延迟之间的差异。

不可靠的置信度校准

决策模型的一个关键特性是提供概率分数,以帮助应用程序决定何时信任答案。无论模型回答正确还是错误,Clef 的置信度分数几乎保持不变(0.81 vs 0.74),而 Jev 则显示出明显的区分度(0.99 vs 0.71),这使得 Jev 在自动化路由逻辑中更有用。

成本效益劣势

尽管输出 token 免费,但 Clef 的输入定价($0.24/M)约为 Jev($0.042/M)的 6 倍。结合更高的延迟,与现有模型相比,高频 API 使用的运营成本显著增加。

Clef-flash 的权衡取舍

较小的 Clef-flash 模型相对于主 Clef 模型提高了速度并降低了成本,但引入了准确性问题,特别是无法区分名称相似的实体(例如「Rowan Systems」与「Rowan Labs」),而较大的模型能正确处理这些情况。

💬 Key Quotes

决策模型跳过了生成段落这一步。你发送输入和一个允许答案的列表,然后为每个选项返回一个概率。没有文本。只需一次传递。

我的数据是从我的机器经过 OpenRouter 的完整往返时间,这是你的应用程序实际看到的。他们的数据是在他们自己的设置上获得的。两者可能都是真的。但只有一个是你现在能得到的。

无论对错置信度数字都一样的话,那它就不是置信度数字。那是噪音。

对于我的应用,Jev 留任。我将在一个月后重新运行相同的测试。

📊 Article Meta

AI Screening: 88

Source: DEV Community: machinelearning

Author: TheRabbitHole

Category: 人工智能

Language: 英文

Read Time: 7 min

Word Count: 1579

Tags:

AI 与智能应用 , 模型发布 , LLM 推理优化 , RAG / 检索增强 , Cloudflare

#AI 与智能应用# 模型发布# LLM 推理优化# RAG / 检索增强# Cloudflare

文章评论(2)

墨沐雨56 分钟前

支持作者,持续关注中。

回复
三分糖去冰2 小时前

看标题就点进来了,内容果然没让人失望。

回复