Jev 与 System One 模型:当 LLM 是错误工具时

📌 One-Sentence Summary
Jev 是一种 「System One」 模型,用结构化且校准的决策(Choice、Score、Noul)取代文本生成,为软件中的分类和路由任务提供更低的延迟和成本。
📝 Summary
本文介绍了 Jev,这是由 TypeSafe AI 开发的一种新型 AI 模型,并非作为生成式聊天机器人,而是作为结构化决策层。与传统 LLM 生成需要后续解析的序列 token 不同,Jev 会并行评估输入状态下的多个问题,并返回预定义选项(schema)的概率分布。核心主张是用三种原语解决分类、检测和路由问题,实现高速低成本:Choice(类别选择)、Score(尺度评估)和 Noul(布尔验证)。文章详细阐述了架构优势,如 schema 合规性保证(消除格式幻觉)以及通过 RLCD 进行的置信度校准,使应用能够基于模型不确定性定义策略。文中还讨论了实际用例、已知局限(如算术和日期)以及将模型判断能力与软件业务逻辑分离的重要性。
💡 Main Points
从文本生成到结构化决策的转变
与 LLM 生成需要验证和解析的 string 不同,Jev 直接返回结构化数据类型(关于封闭选项集的概率),消除了文本处理的中间步骤并减少了格式错误。
并行化与边际成本低
Jev 会并行对同一状态评估请求中的所有问题。添加更多独立问题对延迟和成本的影响极小,从而允许 「speculative fan-out」 模式,在一次调用中完成多维度分析。
置信度校准与策略分离
与 LLM 表达的置信度(在 RLHF 后倾向于过度自信)不同,Jev 使用特定训练(RLCD)提供校准后的概率。这使得应用代码可以定义明确的策略:置信度高时自动执行,置信度低时升级到人工或昂贵的 LLM。
合规性保证 vs 语义精度
公司提到的 「0% 幻觉」 率仅适用于 schema 合规性(模型不会 invent 超出列表的类别)。然而,它仍可能在有效选项内选择错误类别,需要传统的准确率指标来评估语义质量。
💬 Key Quotes
Jev 可以被描述为一个 schema 在运行时定义的零样本分类器。
该公司的论点是,优化模型以迎合人类评估者的偏好会产生良好的对话助手,但也会产生过度自信的模型。
在 TypeScript 中,answers.categoria.choice 被类型化为所定义选项的字面联合,这允许在 switch 中进行穷举检查。
错误的规范不仅会产生不精确的答案,还会产生系统性错误的结果。
📊 Article Meta
AI Screening: 86
Source: DEV Community: machinelearning
Author: Matheus Persch
Category: 人工智能
Language: 英文
Read Time: 17 min
Word Count: 4048
Tags:
AI 与智能应用 , 系统设计 , 模型路由 , LLM 推理优化 , AI Agent
讲解得很细致,新手也能看懂。
不错不错,已加入书签。
赞同,实践出真知。
实测过类似工具,作者说的基本属实。
看完了,收获满满,期待更多更新。
整理得太全面了,省了我不少时间。
整理得太全面了,省了我不少时间。
内容翔实,正好需要,先收藏再看。
路过
看标题就点进来了,内容果然没让人失望。
这个观点很中肯,深有同感。
看标题就点进来了,内容果然没让人失望。