AI 决策的新模型范式?

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-09-22209 阅读💛 222 收藏
AI 决策的新模型范式?

📌 One-Sentence Summary 对 TypeSafe 的 Jev 进行实测,这是一款为结构化决策打造的 System One 模型,发现它比 OpenAI 模型更快、置信度校准更好,但在 77 类银行意图任务上准确率较低,当标签降至 7 类时差距消失。 📝 Summary 文章考察了 TypeSafe.AI 新推出的 Jev 模型,该公司称其为首个 System One 模型:它不预测下一个 token,而是评估一个状态并返回带概率的结构化答案。Jev 使用 RLCD(面向校准决策的强化学习)而非 RLHF 进行后训练,接收一个状态以及通过 Choice、Score、Noul 等原语表达的问题。作者在 PolyAI banking77 数据集这一 77 类意图分类任务上,将 Jev 与 OpenAI 的 Luna 和 Terra 进行基准对比。Jev 达到 79.0% 的准确率,而 Terra 为 83.9%、Luna 为 86.2%,差距具有统计显著性。它消耗的输入 token 约为对手的 2 倍、输出 token 约为 40 倍,因为它会返回全部 77 个意图的概率,因此在这一用例中其宣称的成本优势并不明显,不过 Jev 的速度快了近 2 倍。它的置信度分数校准得尤为出色,准确率随置信度分桶升高而上升。当任务从 77 个标签缩减到 7 个时,Jev 的结果大幅改善,大致与 OpenAI 模型持平,表明类别数量是其主要的短板。作者总结认为,System One 模型在 LLM 作为评判者和分类任务上是一个有前景的方向,校准良好的置信度可以将简单案例路由到廉价模型、将不确定案例升级到前沿模型,但警告称宣传中的速度和成本优势会因工作流而异,应当直接测试。 💡 Main Points System One 模型旨在评估状态并返回带概率的结构化答案,而非生成自由形式的文本。 Jev 以自然语言或 JSON 作为输入,并通过 Choice、Score、Noul 等原语作答。它使用 RLCD 而非 RLHF 进行后训练,TypeSafe 认为这能减少谄媚和自信的幻觉,使模型更适合决策任务。 在 77 类银行意图任务上,Jev 的准确率低于 OpenAI 的 Luna 和 Terra。 Jev 得分为 79.0%,而 Terra 为 83.9%、Luna 为 86.2%,差异具有统计显著性。作者怀疑类别数量多是主要原因,因为将任务缩减到 7 个标签后,Jev 大致与 OpenAI 模型持平。 Jev 的 token 用量削弱了其在这一用例中宣传的成本优势。 Jev 消耗的输入 token 约为 OpenAI 模型的 2 倍、输出 token 约为 40 倍,主要因为它会返回全部 77 个意图的概率。即便单 token 价格更低,作者也不认为它在这一特定任务上明显更便宜。 Jev 的置信度分数校准良好,这是它最具吸引力的实际优势。 准确率随置信度分桶升高而持续上升,提供了可用于路由的有效信号。作者建议对高置信度案例使用快速廉价的模型,将不确定的案例升级到前沿模型,不过 OpenAI 模型目前不返回对数概率,无法直接对比。 TypeSafe 的速度和成本说法应按工作流逐一验证,而非从基准测试中想当然。 Jev 在本次测试中快了近 2 倍,支持了部分说法,但作者指出收益会因用例而异,建议在自己的任务上测试,而不是直接相信基准数字。 💬 Key Quotes 虽然 LLM 被训练来预测下一个 token 并生成我们一直享受的长文本和对话,但 System One 模型是为评估状态并产生结构化答案而构建的。 在准确率上,Jev 的表现明显逊于两个 OpenAI 模型:79.0%,而 Terra 为 83.9%、Luna 为 86.2%。差异具有统计显著性。 真正令人印象深刻的是置信度分数的校准程度:准确率随置信度分桶升高而持续上升。 当我把任务从 77 个标签缩减到仅 7 个时,结果显著改善,大致与 OpenAI 模型持平。 我仍然预计实际收益会因用例而有很大差异。所以值得在你自己的任务上测试,而不是假设基准数字会直接转化。 📊 Article Meta AI Screening: 86 Source: Towards Data Science Author: Mariya Mansurova Category: 人工智能 Language: 英文 Read Time: 7 min Word Count: 1706 Tags: AI 与智能应用 , 模型训练与推理 , AI 产品与应用 , AI 工程 , 模型评测与基准 Read Full Article

#AI 与智能应用# 模型训练与推理# AI 产品与应用# AI 工程# 模型评测与基准

文章评论(0

暂无评论,快来抢沙发~