我把一张安全照片标注为危险,六个视觉模型中有两个开始认出危险。一个基准测试表明,虽然视觉模型可以有效地检测到真实危害,但它们容易受到暗示:具体来说,当提示是 '安全检查员' 上下文时,Gemini 3.1 Pro 和 GPT-5.5 对安全照片的误报率显著增加。

AI小蝌蚪AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-10-10711 阅读💛 139 收藏
我把一张安全照片标注为危险,六个视觉模型中有两个开始认出危险。一个基准测试表明,虽然视觉模型可以有效地检测到真实危害,但它们容易受到暗示:具体来说,当提示是 '安全检查员' 上下文时,Gemini 3.1 Pro 和 GPT-5.5 对安全照片的误报率显著增加。

📌 One-Sentence Summary

对 100 张照片进行的基准测试表明,虽然视觉模型在检测真实危害方面非常有效,但它们容易受到暗示;具体来说,Gemini 3.1 Pro 和 GPT-5.5 在被提示 '安全检查员' 上下文时,对安全照片的误报率显著增加。

📝 Summary

本研究评估了视觉语言模型在识别日常生活场景中安全隐患的可靠性。结果表明,虽然像 Gemini 3.7 Flash 这样的模型具有高的召回率和精度,但其他模型(Gemini 3.1 Pro 和 GPT-5.5)则表现出较大的不稳定,在受到引导性提示后,其误报率几乎翻倍。分析还强调,约一半的误报是由模型基于场景类别的先验期望造成的,而不是基于视觉证据。

💡 Main Points

视觉模型的易受暗示性

该实验表明,视觉模型并非不受认知偏差影响。当加入一个建议照片可能有危险的句子时,Gemini 3.1 Pro 和 GPT-5.5 将安全照片分类为有害的比例明显提高,这表明他们缺乏对引导性信息的鲁棒性。

高召回率,低精度

在所有模型中,对实际危害的召回率都非常高(90-100%),也就是说它们很少会遗漏真实 danger。然而,精度却差异很大,有些模型会将高达 61% 的安全照片标记为危险,这表明它们倾向于过度标记而非遗漏。

基于类型的误分类

大量误报(44-58%)似乎是由模型对场景类别的内在关联驱动的。例如,模型可能会因为游泳池通常有栅栏而将一张游泳池照片标记为 '无栅栏' 危害,即使该照片实际上显示的是一个非常安全的区域。

💬 Key Quotes

'一个总是大声喊叫的系统会被屏蔽,而一个被屏蔽的警报什么也捕获不了。'

'我想知道模型是读像素还是读类别,以及一个句子的建议是否足以改变它们 '看到' 的东西。'

'过度标记并不是随机的杜撰。它是对现实场景的过度解读,这些场景看起来很像会发生危险的地方。'

📊 Article Meta

AI Screening: 88

Source: DEV Community: machinelearning

Author: Clivin John

Category: 人工智能

Language: 英文

Read Time: 11 min

Word Count: 2610

Tags:

AI 与智能应用 , 提示工程 , 计算机视觉 , 模型评测与基准 , 大语言模型 (LLM)

#AI 与智能应用# 提示工程# 计算机视觉# 模型评测与基准# 大语言模型 (LLM)

文章评论(0)

暂无评论,快来抢沙发~