Jev 现已在 LangSmith Evals 中可用

📌 One-Sentence Summary Jev 是一种 System One 模型,它返回类型化答案而非生成文本,现已在 LangSmith Evals 中作为评判器可用,为评估开放式智能体行为提供了一种比 LLM-as-a-judge 更快、更便宜且更一致的替代方案。 📝 Summary LangChain 宣布,来自 TypeSafe AI 的 System One 模型 Jev 现已在 LangSmith 中作为评估评判器可用。文章梳理了智能体评估从基于代码的检查到 LLM-as-a-judge 的演进历程,并将 Jev 定位为第三种选择——它直接返回类型化答案(noul、choice、score),而非生成自由文本。据 TypeSafe AI 称,Jev 在分类任务上比同类 LLM 便宜最多约 450 倍、快约 200 倍,并且能并行评估关于同一状态的多个问题。在 LangChain 针对 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 进行的测试中,Jev 在每一项决策上都与人类评审员一致,方差低 92-913 倍,平均每次调用耗时 0.44 秒,而其他模型为 2.16-2.83 秒,完整评判集成本为 $0.34,而其他模型分别为 $0.39、$2.90 和 $28.17。文章还提供了在 LangSmith 中配置 Jev-as-a-judge 评估器的六步设置指南,并指出 TypeSafe 目前不提供零数据保留。 💡 Main Points Jev 引入了智能体评估的第三种类别,与基于代码和 LLM-as-a-judge 并列。 基于代码的评估器快速且确定性强,但只能覆盖预先指定的条件;而 LLM-as-a-judge 能处理开放式行为,代价是速度、成本和不确定性。Jev 作为一种 System One 模型,直接返回类型化答案(noul、choice、score)而非生成文本,以牺牲部分基于代码的速度换取灵活性,成本仅为 LLM 评判器的一小部分。 成本和速度优势使得可以对每条追踪记录进行评估,而非仅抽样。 据 TypeSafe AI 称,Jev 在分类任务上比同类 LLM 便宜最多约 450 倍、快约 200 倍。这消除了团队在评估覆盖范围和预算之间面临的取舍,使他们能够对每条追踪记录进行评分、对每条追踪记录检查更多标准,并加快智能体改进循环。 并行问题评估使得多标准评分的成本仅比单标准评分略高。 Jev 会一起评估请求中的每个问题,因此添加诸如 PII 泄露、用户意图和用户挫败感等问题几乎不会改变响应时间,只需为额外问题支付 token 费用。相比之下,LLM 评判器需要为每个标准单独调用,或进行顺序推理,输出 token 随标准数量增加而增长。 在 LangChain 的测试中,Jev 在每一项决策上都与人类评审员一致,且方差和成本大幅降低。 Jev 的方差比 LLM 评判器低 92-913 倍,平均每次调用耗时 0.44 秒,而其他模型为 2.16-2.83 秒,完整评判集成本为 $0.34,而其他模型分别为 $0.39(GPT-5.6 Luna)、$2.90(GPT-5.6 Terra)和 $28.17(Claude Sonnet 4.6)。作者指出这仅是在一个智能体上进行的一次测试,并称其为有前景的早期迹象。 Jev 并未使 LLM 评判器过时;它适用于狭窄、类型化、高频的决策。 微调模型和开放模型可以成为有效的低成本评判器,而当需要在裁决之外提供书面推理时,LLM 评判器仍然更优。Jev 最适合决策范围狭窄、类型化且高频的场景,例如 PII 泄露或提示注入等安全或安全标志。 💬 Key Quotes System One 模型是一类旨在做出快速、结构化决策以供软件直接使用的 AI 模型。System One 模型评估一个状态并返回类型化答案和概率。 System One 模型会并行评估请求中的每个问题。添加问题几乎不会改变响应时间,只需为额外问题支付 token 费用,而这些费用很便宜。 当你需要的决策范围狭窄且类型化,并且需要高频做出时,Jev 是一个很好的选择。 这仅是在一个智能体上进行的一次测试,但结果是一个有前景的早期迹象,表明 Jev-as-a-judge 是继基于代码和 LLM-as-a-judge 之后第三种可行的智能体评估类型。 📊 Article Meta AI Screening: 87 Source: LangChain Blog Author: Winston Huynh Category: 人工智能 Language: 英文 Read Time: 7 min Word Count: 1622 Tags: AI 与智能应用 , AI 工程 , 可观测性 , 模型评测与基准 , AI Agent Read Full Article
暂无评论,快来抢沙发~