Jev,一个写不出一个字的模型,以及它在网页抓取中的定位(真的适合吗?)

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-21480 阅读💛 185 收藏
Jev,一个写不出一个字的模型,以及它在网页抓取中的定位(真的适合吗?)

📌 One-Sentence Summary Jev 是一种非生成式的「系统一」模型,它根据数据评估类型化问题,返回概率和分类结果,为网页抓取流程中的数据质量把关和决策提供低延迟、高性价比的 LLM 替代方案。 📝 Summary 本文探讨了由 TypeSafe 设计的非生成式 AI 模型「Jev」在网页抓取工作流中的实际应用。与生成文本的自回归 LLM 不同,Jev 根据预定义的「Noul」(是/否)、「Choice」(选择)和「Score」(评分)类型来评估输入数据,返回结构化的概率和决策。作者展示了它作为「门控」——即提取后检查数据质量的后处理层——以及作为路由逻辑「开关」的实用性。通过一个抓取图书数据的案例研究,作者表明 Jev 能有效检测标准正则表达式或空值检查所遗漏的「静默」数据错误(如描述不匹配)。文章强调了与生成式模型相比在成本和延迟方面的显著优势,同时提醒 Jev 是非确定性的,需要精心设计问题以避免「垃圾进、垃圾出」的情况。文章总结道,虽然 Jev 不能替代结构性代码检查,但它为高容量、低成本的决策提供了一个强大的专用工具。 💡 Main Points Jev 是一种非生成式的「系统一」模型 与生成文本的自回归模型不同,Jev 并行地根据特定的类型化问题(Noul、Choice、Score)评估数据,返回概率和分类结果,而不生成输出 token。 在抓取中的最佳角色:数据质量门控 Jev 擅长在提取后审计记录,以检测结构性代码(正则表达式/空值检查)无法识别的逻辑不一致——例如描述不匹配。 显著的成本和延迟优势 由于输出 token 免费且问题并行评估,Jev 提供可预测的亚秒级延迟,在分类任务上比生成式模型便宜约 7 倍。 非确定性行为和设计约束 Jev 不是确定性的;边界答案在重复调用中可能波动。此外,它无法生成文本,这意味着它必须用于在选项之间做决定,而非执行提取本身。 💬 Key Quotes Jev 不是被训练来生成文本的。 输出 token 是免费的,答案总是以你要求的格式返回,而且每条记录的调用速度足够快,不会成为瓶颈。 如果正则表达式、状态码或 CSS 类能回答问题,就不要问模型。 门控在完成工作后运行,针对你已经构建好的记录,决定是否信任它。 Jev 不是确定性的。在重复的相同调用中,自信的答案保持稳定,而边界答案则漂移了几个百分点。 📊 Article Meta AI Screening: 86 Source: DEV Community: machinelearning Author: Ayan Pahwa Category: 人工智能 Language: 英文 Read Time: 12 min Word Count: 2886 Tags: AI 与智能应用 , AI 工程 , 系统设计 , AI 产品与应用 , LLM 推理优化 Read Full Article

#AI 与智能应用# AI 工程# 系统设计# AI 产品与应用# LLM 推理优化

文章评论(0

暂无评论,快来抢沙发~