Jev 与 System One 模型:当 LLM 是错误工具时

清风徐来AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-26272 阅读💛 31 收藏
Jev 与 System One 模型:当 LLM 是错误工具时

📌 One-Sentence Summary

Jev 是一种 「System One」 模型,用结构化且校准的决策(Choice、Score、Noul)取代文本生成,为软件中的分类和路由任务提供更低的延迟和成本。

📝 Summary

本文介绍了 Jev,这是由 TypeSafe AI 开发的一种新型 AI 模型,并非作为生成式聊天机器人,而是作为结构化决策层。与传统 LLM 生成需要后续解析的序列 token 不同,Jev 会并行评估输入状态下的多个问题,并返回预定义选项(schema)的概率分布。核心主张是用三种原语解决分类、检测和路由问题,实现高速低成本:Choice(类别选择)、Score(尺度评估)和 Noul(布尔验证)。文章详细阐述了架构优势,如 schema 合规性保证(消除格式幻觉)以及通过 RLCD 进行的置信度校准,使应用能够基于模型不确定性定义策略。文中还讨论了实际用例、已知局限(如算术和日期)以及将模型判断能力与软件业务逻辑分离的重要性。

💡 Main Points

从文本生成到结构化决策的转变

与 LLM 生成需要验证和解析的 string 不同,Jev 直接返回结构化数据类型(关于封闭选项集的概率),消除了文本处理的中间步骤并减少了格式错误。

并行化与边际成本低

Jev 会并行对同一状态评估请求中的所有问题。添加更多独立问题对延迟和成本的影响极小,从而允许 「speculative fan-out」 模式,在一次调用中完成多维度分析。

置信度校准与策略分离

与 LLM 表达的置信度(在 RLHF 后倾向于过度自信)不同,Jev 使用特定训练(RLCD)提供校准后的概率。这使得应用代码可以定义明确的策略:置信度高时自动执行,置信度低时升级到人工或昂贵的 LLM。

合规性保证 vs 语义精度

公司提到的 「0% 幻觉」 率仅适用于 schema 合规性(模型不会 invent 超出列表的类别)。然而,它仍可能在有效选项内选择错误类别,需要传统的准确率指标来评估语义质量。

💬 Key Quotes

Jev 可以被描述为一个 schema 在运行时定义的零样本分类器。

该公司的论点是,优化模型以迎合人类评估者的偏好会产生良好的对话助手,但也会产生过度自信的模型。

在 TypeScript 中,answers.categoria.choice 被类型化为所定义选项的字面联合,这允许在 switch 中进行穷举检查。

错误的规范不仅会产生不精确的答案,还会产生系统性错误的结果。

📊 Article Meta

AI Screening: 86

Source: DEV Community: machinelearning

Author: Matheus Persch

Category: 人工智能

Language: 英文

Read Time: 17 min

Word Count: 4048

Tags:

AI 与智能应用 , 系统设计 , 模型路由 , LLM 推理优化 , AI Agent

#AI 与智能应用# 系统设计# 模型路由# LLM 推理优化# AI Agent

文章评论(12)

杨丽华19 小时前

讲解得很细致,新手也能看懂。

回复
墨沐雨21 小时前

不错不错,已加入书签。

回复
龙文博19 小时前

赞同,实践出真知。

回复
星寻梦20 小时前

实测过类似工具,作者说的基本属实。

回复
雪知秋18 小时前

看完了,收获满满,期待更多更新。

回复
雪影18 小时前

整理得太全面了,省了我不少时间。

回复
南山客16 小时前

整理得太全面了,省了我不少时间。

回复
星寻梦17 小时前

内容翔实,正好需要,先收藏再看。

回复
陈皮话梅糖18 小时前

路过

回复
龙文博17 小时前

看标题就点进来了,内容果然没让人失望。

回复
空向阳17 小时前

这个观点很中肯,深有同感。

回复
墨沐雨16 小时前

看标题就点进来了,内容果然没让人失望。

回复