我给两个 AI 模型相同的指令,它们以相反的方式出错

📌 One-Sentence Summary
对 OpenAI、Gemini 和 Claude 在处理批量客服工单时的对比测试显示,相同的指令会导致相反的误差模式(过度消极 vs. 过度宽容),并凸显了提示词清晰度及思考预算等模型特定配置的重要性。
📝 Summary
作者进行了一项开源基准测试,评估了三个 AI 模型(OpenAI gpt-4.1-mini、Google Gemini 3.5-flash-lite 和 Anthropic Claude Haiku 5.5)在批量处理 1000 条合成客户支持聊天时的可靠性。研究聚焦于四项分类任务:产品识别、问题类型、情感分析和后续跟进必要性。主要发现包括:(1) 提示词的模糊性导致了显著错误;澄清一个问题后,准确率从 31% 提升至近 100%。(2) 模型在情感分析中表现出截然不同的失败模式——OpenAI 倾向于将问题与不快乐混淆从而显得过于消极,而 Gemini 因严格遵循指令忽略明确的不满情绪从而显得过于宽容。(3) Claude 引入了与「思考」令牌相关的新挑战,其内部推理有时会在未给予更大令牌限制或禁用该功能时截断输出。结果表明,切换模型可能会扭曲业务指标,这并非因为数据发生了变化,而是因为每个模型解读指令的方式不同。
💡 Main Points
对于基础任务,提示词清晰度比模型选择更具影响力。
在初步测试中,关于「后续跟进需求」的模糊措辞导致 OpenAI 和 Gemini 的准确率仅为 31%。增加一句定义该术语的解释性语句后,准确率提升至近 100%,这表明看似模型的失败往往实际上是沟通的失败。
模型在情感解读中表现出系统性且相反的偏差。
当被指示判断对产品而非问题本身的情感时,OpenAI 经常将礼貌的投诉误判为负面(过于悲观),而 Gemini 则经常将明确的不满误判为中性(过于乐观)。这表明不同的架构具有独特的解释倾向,会影响下游分析的一致性。
「思考」模式等高级功能需要精细的资源管理。
Claude Haiku 5.5 在其自动「思考」模式激活时,有 10/1000 的案例未能返回完整答案,可能是由于内部推理期间耗尽令牌限制所致。禁用此功能或增加输出缓冲区解决了该问题,凸显了 LLM 中不透明中间步骤带来的操作风险。
批量 API 的可靠性因供应商的基础设施处理方式而异。
虽然所有模型都成功处理了大部分请求,但 Gemini 遇到了一种特定故障,其模型列表声称提供已弃用模型的服务,导致提交时被拒绝。此外,失败的上传未被自动清理,需要在工具代码中进行手动干预。
💬 Key Quotes
相同的指令,相反的错误。
当模型似乎出错时,首先检查你是否真正传达了你的意图。
如果你切换模型,数字会发生变化,这并不是因为你的客户改变了。
开启思考模式时,它大多过于宽容,像 Gemini……关闭思考模式时,它大多过于消极,像 OpenAI。
📊 Article Meta
AI Screening: 86
Source: DEV Community: machinelearning
Author: Ankur Kotwal
Category: 人工智能
Language: 英文
Read Time: 5 min
Word Count: 1214
Tags:
AI 与智能应用 , 提示工程 , 模型评测与基准 , LLM 推理优化 , 大语言模型 (LLM)
点赞,必须点赞
看完了,收获满满,期待更多更新。
有没有更详细的教程,期待后续。
看标题就点进来了,内容果然没让人失望。
不错不错,已加入书签。