Jev 能被谁替代:一份实时公开榜上的 25 个候选

林知秋AI 前沿📡 觉醒AI2026-09-211058 阅读💛 88 收藏

有人在认真做这件事了。

Cuth 从 9 月 19 日开始跑一个叫 S1Bench 的公开基准,把 Jev 的替代品放在同一批公开测试集、同一套提示词上和 Jev 1.13.0 正面比。写下这段时榜上有 25 个跑完或跑了一部分的候选,队列里还有 40 多个,而且他的 agent 会自动去 X 上捞新的放进队列。

榜单是只读的、每 15 秒刷新,每个数字都直接读自运行文件。

为什么这事值得单独讲: 我们之前自己测过 Laya 和 Jev 的对照(40 条中文客服分类),样本小、只有一个领域。这份榜是独立第三方、六个公开子集、每个子集 1999 条起,正好能校正我们那种小样本的偏差。

一、榜单长什么样

先看锚点。Jev 在六个子集上的宏平均是 0.775,每项 0.42 秒、每秒 2.4 次决策、ECE 0.076。

六个子集是:vitaminc-dev(事实核验)、massive-en-US(意图分类)、boolq(是/否问答)、helpsteer2(有用性打分)、aegis2(安全判定)、paws(释义识别)。

其余模型按宏准确率排(摘录):

Jev 1.13.0(锚点) 0.775 基准 ECE 0.076

simplejev-qwen38-27b 0.758 -0.010 ECE 0.121 27B API

djev-full 0.749 -0.020 ECE 0.166 26B 本地

simplejev-qwen36-35b-a3b 0.744 -0.024 ECE 0.136 35B API

reflex-4b 0.719 -0.049 ECE 0.085 4B 本地

decider-2b 0.703 -0.065 ECE 0.114 2B 本地

jeff-gpu 0.664 -0.137 ECE 0.050 400M 本地

laya-gpu 0.625 -0.143 ECE 0.130 421M 本地

jeff 0.561 -0.207 ECE 0.075 400M 本地

几个立刻能看出来的东西:

第一,Jev 还在顶端,但差距在缩小。 最好的替代品(simplejev-qwen38-27b)只差 1.0 个百分点。Cuth 自己的说法是:「别让人说服你这是我们一直就有的工具,它是这个范式的前沿——但它正在快速丢地盘,我明天可能就找到更好的了。」

第二,速度的代价是可量化的。 Jev 每秒处理 2.4 次决策,djev-full 是 3.7 次,reflex-4b 7.2 次,decider-2b 27 次,jeff-gpu 42 次。用几个百分点的准确率换十倍的吞吐,在很多场景下是划算的。

第三,校准这事儿有意思。 Jev 的 ECE 是 0.076,反而不是最好的——jeff 只有 0.075、jeff-gpu 0.074、reflex-4b 0.085。而 djev-full 是 0.166,比 Jev 差一倍多。准确率和校准是两条独立的轴。

二、Cuth 自己给的前五名

他在推文里排的序(和榜单的宏准确率排序不完全一致,因为他看的是速度/准确率/体积的权衡):

  1. djev —— 准确率略低于 Jev,速度略快。他认为这个权衡值得。榜单上 djev-full 是 0.749、每秒 3.7 次。

  2. simplejev-qwen38-27b —— 「今天你能拿它替换 Jev 的最好的开源模型」,但需要能跑 27B。他的原话是可能需要 DGX Spark 这类机器。榜单上它 0.758,是最接近 Jev 的。他还特别喊话希望有人把 Qwen Flash Next 也做成 SimpleJev 版本来打败 Jev。

  3. reflex-4b(huggingface.co/YannQi/R-4B,Apache-2.0,185 赞)—— 他自己的最爱之一,「速度和准确率之间的绝佳权衡」。比 Jev 快 2 到 3 倍,准确率低 5% 左右。榜单上是 0.719、每秒 7.2 次、ECE 0.085。

  4. decider-2b(Mapika/decider-2b,Apache-2.0,54 赞)—— 「整个测试大概 4 分钟就跑完了,快得离谱」。约比 Jev 快 10 倍、完全本地,准确率低 5%。榜单上每秒 27 次。「考虑到它的体积,你可以把这家伙扔在办公电脑上快速干活。」

  5. Laya —— 「那个历史性的、没有得到足够爱的模型」。在 GB10 上很快,但准确率 62.5%,他认为不值得。他画了一条线:低于 70% 的不要考虑。

三、和我们自己实测的对照

这一点我必须说清楚,因为它同时验证和修正了我们之前的结论。

验证的部分: 我们在 40 条中文客服分类上测出 Laya 57%、Jev 78%,差距 21 个点。S1Bench 在六个公开子集 1999 条上测出 Laya 62.5%、Jev 77.5%,差距 15 个点。量级一致,方向一致。 我们那个小样本结论站得住。

修正的部分: 我们当时说「级联是个好方案」——但在 S1Bench 的数据里,这个判断要加限定条件。看 ECE:Laya 0.130、Jev 0.076。Laya 的校准更差,意味着「用置信度决定要不要升级」这条策略的上限比我们想的低。我们那个级联之所以有效(准确率追平 Jev、快 1.8 倍),是因为我们在一个任务域上调了阈值;换到六个异构子集上,同一个阈值大概率会失效。

还有一条我们没测到的: Laya 在 S1Bench 上标着 ≤512 tok 的约束(它的上下文上限就是 512),而其他候选是 ≤2000、≤4096 甚至 ≤32768。这是个真实的架构限制,长输入场景下它直接出局。

四、几个技术细节值得注意

榜单诚实标注了污染问题。 decider-2b 那行写着 contamination: many-public-decision-datasets;mini-jev 标着 contamination: clinc150(its own experiment task)。把训练集污染写在榜上,这个做法值得尊重。

有明确停止的条目,理由也写了。 litjev-27b 那行:stopped early: halted 2026-09-19 after vitaminc-dev (599 items, acc 0.711 vs Jev 0.801, paired p<0.0001, CI half-width 0.036): settled far behind, not worth the box time。带配对检验、置信区间、以及「不值得再花机时」的判断。

没跑完的标 stopped,跑完的标 done。 不把部分结果混进总排名。

参数列区分 cpu/gpu/api。 jeff-gpu 是 400M gpu 每秒 42 次,jeff 是 400M gpu 每秒 0.7 次——同一个模型不同配置,差了 60 倍。这提醒了一件事:「同一个模型」的性能可以差一个数量级,取决于怎么部署。

五、这意味着什么

Jev 的位置: 它仍然是这个范式的前沿,但不再是不可替代的。最接近的开源替代差 1 个百分点(simplejev-qwen38-27b),而 4B 的 reflex 用 4.9 个百分点的代价换了 3 倍速度。

选择框架正在变得清晰:

需要最高准确率、不在乎体积 → simplejev-qwen38-27b(27B)

要平衡 → reflex-4b(4B、Apache-2.0、每秒 7.2 次)

要极致速度和本地 → decider-2b(2B、每秒 27 次)

要最好的校准 → jeff-gpu(ECE 0.050)

要闭源 API → Jev(0.775,但 0.42 秒一项)

一条给读者的实操建议: 如果你的任务是单一领域,Laya 这类小模型配上专门的阈值仍然可用(我们自己测的级联就是例子)。但如果你的任务跨多个异构子集,S1Bench 的数据说明小模型的泛化差距是实打实的——这时候要么上 27B,要么接受准确率损失。

最后,Cuth 那句提醒值得记下: 「别让人说服你 Jev 不特别,或者这是我们一直就有的工具。」

这句话是双向的——既别因为它开源了就轻视它,也别因为它闭源就以为没人能替代。这个领域正在以周为单位变化,唯一可靠的做法是自己有一份能跑的基准。

链接

原推(Cuth):https://x.com/ItsCuthulhu/status/2101491913866055821

S1Bench 实时榜:http://bench.jakecuth.com

djev:https://djev.dev/

simplejev:https://simple-jev.featherless.ai/

Reflex-4B:https://huggingface.co/YannQi/R-4B

decider-2b:https://huggingface.co/Mapika/decider-2b

我们的对照实测(40 条中文客服分类 + 级联):https://github.com/yibie/laya-jev-lab

#模型对比 #基准测试 #决策引擎

原文信息

作者:一别(@yibie)

原文地址:

文章评论(4

云逐月38 分钟前

讲解得很细致,新手也能看懂。

回复
星寻梦2 小时前

思路清晰,干货满满。

回复
陈皮话梅糖1 小时前

整理得太全面了,省了我不少时间。

回复
南山客1 小时前

支持作者,持续关注中。

回复