Jev 推出一种新形态的 LLM——System One,即决策模型

空逐月AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-09-22767 阅读💛 100 收藏
Jev 推出一种新形态的 LLM——System One,即决策模型

📌 One-Sentence Summary TypeSafe AI 的 Jev 推出了一类新型 LLM,它返回带类型的概率化决策而非文本,提供极其廉价且快速的分类能力,但也将机器学习进一步推向不透明的黑箱。 📝 Summary TypeSafe AI 推出了 Jev,这是其所谓「System One 模型」中的首个产品(Simon Willison 更倾向于 Maggie Appleton 的术语「决策模型」)。Jev 接受文本或半结构化的「状态」输入,但返回的是浮点数而非文本:针对是/否(「Noul」)问题的置信度分数、选项上的概率分布,以及在指定范围内的数值评分。它速度极快且成本低廉,仅对输入收费,价格为每百万 token 0.042 美元,输出免费。Willison 认为决策模型这一框架对于垃圾邮件检测、标注、排序和搜索重排等分类任务很有用,并指出社区已经构建了趣味演示(jevchat、jev-leftpad、jev-2048),以及开放权重复刻版如 Kev 和 JevBench 基准测试。他主要的担忧在于,Jev 代表了向黑箱机器学习的一次倒退:它不为输出提供任何理由,使偏见更难被发现,也让评估变得比以往更加重要。 💡 Main Points Jev 为 LLM 引入了一种新的输出格式:带类型的概率化决策而非文本。 它接受文本或半结构化的「状态」输入,但针对三种问题类型返回浮点数:是/否(Noul)置信度分数、带概率分布的选项问题,以及沿数值范围的评分问题。 Jev 比传统 LLM 便宜且快速得多。 它仅对输入收费,价格为每百万 token 0.042 美元,输出免费,比 OpenAI 的 GPT-5 Nano 更便宜,并且并行评估多个问题,因此发送许多问题所需时间与发送一个问题相近。 决策模型这一框架明确了 Jev 的适用场景:分类式任务。 Willison 建议用于垃圾邮件检测、标签建议、优先级排序、排名和搜索重排,其中 100 个 BM25 候选结果可以针对原始查询进行相关性评分。 Jev 加深了机器学习中的黑箱问题。 与常规 LLM 不同,Jev 不为输出提供任何理由,因此偏见问题变得至关重要;Willison 警告不要将其用于给求职者排名等用途,并指出评估和结构化实验变得比以往更加重要。 社区的反应异常迅速且富有创意。 一周之内,jevchat、jev-leftpad 和 jev-2048 等项目相继出现,同时还有开放权重复刻版如 Kev(基于 Qwen 3.5 构建)以及用于比较决策模型的 JevBench 基准测试。 💬 Key Quotes 把 Jev 想象成一次前沿智能函数调用:输入非结构化状态,输出带类型的概率化决策。 LLM 本来就是黑箱——你可以要求它们为自己的决策提供理由,但你无法保证它们所说的有用或准确。 Jev 连这一点都不给你:你想输入多少文本都行,唯一能拿回来的就是一个浮点数。 我真的希望没有人用 Jev 来给求职者排名——那个浮点数可能掩盖了模型中各种看不见的偏见,而通过实验把这些偏见拆解出来将是一件棘手的事。 考虑到 Jev 发布还不到一周,围绕它的活动量令人印象极其深刻。 📊 Article Meta AI Screening: 88 Source: Simon Willison's Weblog Author: Simon Willison Category: 人工智能 Language: 英文 Read Time: 4 min Word Count: 841 Tags: AI 与智能应用 , 模型发布 , 开放权重模型 , AI 产品与应用 , 机器学习 Read Full Article

#AI 与智能应用# 模型发布# 开放权重模型# AI 产品与应用# 机器学习

文章评论(0

暂无评论,快来抢沙发~