你的 AI 思考太久:关于「系统 1」AI 的解析

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-10-01501 阅读💛 51 收藏
你的 AI 思考太久:关于「系统 1」AI 的解析

📌 One-Sentence Summary

文章认为,快速非生成式决策模型(System 1 AI)可以在更低成本和延迟的情况下处理大多数封闭式问答的业务任务。作者自身的 30 个测试案例表明,basal-4.5B 的准确率能媲美「思考模型」,且速度快 33 倍。

📝 Summary

文章追踪了人工智能行业过去两年向着缓慢且深思的「系统 2」推理模型(如 o1、Claude 3.7 Sonnet、Qwen3、GPT-5)倾斜的趋势,并认为这对于大多数商业决策来说过于复杂。文章介绍了 TypeSafe AI 于 2026 年 9 月推出的 Jev,它返回允许答案的概率分布而非生成文本;以及建立在 Bielik 之上的开源 Apache-2.0 波兰语/英语替代品 basal。作者还引用了 Meta 2024 年的蒸馏研究,显示快速模型在判断任务上可以匹敌慢速模型(人类一致性分别为 58.4% 与 49.1%,使用 4 vs 2118 个 token),但在涉及学校数学时则落后明显(7.1% 与 52.8%)。在作者自测的 30 个波兰语客户服务决策中,思考模型准确率略高(29 比 27),但每次决策耗时 3.9 秒,远慢于 basal 的 118 毫秒;并且在更严格的置信度阈值下,basal-4.5B 独立处理了 23 个案例且全部正确,为无法确定的案例提供了干净的分配给人类处理的机制。文章最后提供了一份将此方法应用于实际流程的实用清单。

💡 Main Points

人工智能行业在仅需快速封闭式决策的任务上过度投资于缓慢的推理模型。

自 OpenAI 于 2024 年 9 月推出 o1 后,厂商便聚力于「系统 2」模型,即在回答前进行「思考」。这对于数学和代码题有所帮助,但对于大多数客户服务和后台问题来说,这种方式浪费了大量的 token 和时间,这些问题通常都有确定的答案(比如归属球队、是否为投诉、是否可以发送)。

像 Jev 和 basal 这样的决策模型提供了一种根本不同的接口:它们返回允许答案的概率分布,而非生成文本。

Jev 接收一个情景和一个类型化的问题(选择、评分或是与否),并返回一个概率分布,声称每次决策耗时 70-500 毫秒,输入百万 tokens 成本为 0.042 美元,且无输出成本。basal 是建立在 Bielik 上的开源 Apache-2.0 替代方案,拥有相同的接口,并在 63,663 个决策示例上进行了微调,使置信度 0.9 含义约为 90% 的准确率。

Meta 的蒸馏研究表明,快速模型可以在判断任务中匹敌慢速模型,但在需要逐步推理的任务上表现不佳。

在回答质量评判任务中,快速模型使用 4 个 token 与人类达成一致的概率为 58.4%,而慢速方法使用 2,118 个 token 的一致率为 49.1%。但在 GSM8k 数学题中,快速版本得分为 7.1%,远低于一步步推理的 52.8%,这划清了边界:适合快速模型处理封闭式决策,适合慢速模型或人类处理需要推导的任务。

作者在 30 个案例上的测试显示,思考模型略占上风,但速度慢得多,且置信度阈值让快速模型在操作上更实用。

Qwen3-14B 在思考模式下得分 29/30,高于 basal 模型的 27/30,但每次决策耗时 3.9 秒,远慢于 basal-4.5B 的 118 毫秒。在更严格的置信度阈值下(至少 0.913,设定为约 1% 错误率),basal-4.5B 独立处理了 30 个案例中的 23 个,且全部正确,这为无法确定的案件提供了一个干净的分配给人类处理的方式,而思考模型则缺乏这种机制。

速度不仅决定可负担的程度,还决定哪些产品是可以构建的。

语音代理在每次回合中暂停数秒会感觉像是坏掉了,而在数十毫秒内做出决策则适应了人们在对话回合之间留出的 0-200 毫秒的间隙(Stivers 等,PNAS 2009),使得可以在每次回合中进行路由、升级和安全检查,而通话者几乎感觉不到。

💬 Key Quotes

如果给生成式模型相同的工作,它会写出一句话,而你的代码必须寄希望于这句话中包含它期望的词语。而决策模型无法从列表之外回答。

实用规则是:将封闭式答案的决策交给快速模型,而需要推导的任务则交给慢速模型或人类。

思考模型更准确,但在这个设置中它不提供类似的置信度数字,因此无法知道哪些答案值得信赖,除非再次检查。

速度还决定你可以构建哪些产品。

在更严格的置信度阈值下(至少 0.913,设定为约 1% 错误率),basal-4.5B 独立处理了 30 个案例中的 23 个,且全部正确。

📊 Article Meta

AI Screening: 88

Source: DEV Community: machinelearning

Author: Grzegorz Brzezinka

Category: 人工智能

Language: 英文

Read Time: 14 min

Word Count: 3253

Tags:

AI 与智能应用 , 模型蒸馏 , AI 工程 , AI Agent , LLM 推理优化

#AI 与智能应用# 模型蒸馏# AI 工程# AI Agent# LLM 推理优化

文章评论(1)

杨丽华28 分钟前

内容翔实,正好需要,先收藏再看。

回复