我的 RAG 评估通过了,但引用依然错误

📌 One-Sentence Summary
本文指出标准 RAG 评估往往遗漏关键的引用错误(即答案正确但归因于矛盾来源),并提出通过声明级验证门控和 CI 回归测试来确保证据完整性。
📝 Summary
作者强调了检索增强生成 (RAG) 系统中一种危险的失败模式:「引用洗白」(citation laundering),即正确的答案被配对以错误或相互矛盾的源文档。诸如检索相关性或通用事实依据等标准指标通常会放过这些情况,因为它们并不验证特定声明与其证据之间的具体联系。文章建议将生成的答案分解为原子声明,并实施一个生成后的「引用门控」(citation gate),利用确定性规则或 NLI 模型检查源是否存在、版本是否一致以及语义上是否支持该声明。文章强调应测试证据的强度(例如区分「可能」与「将会」),而不仅仅是关键词重叠,并建议将具体的引用 bug 添加到 CI 流水线中作为回归测试。
💡 Main Points
标准 RAG 指标无法检测错误归因的引用。
常见的检查项会验证文档是否被检索到,或者答案是否有普遍的事实依据,但它们并未确认所引用的特定源文档实际上是否支持所做的确切声明。这导致了一种「危险」的失败模式:正确答案却引用了相互矛盾的政策。
必须将答案分解为原子声明以实现精确验证。
单个句子可能包含多个由文档不同部分支持的声明,甚至完全缺乏支持。评估者应将每个原子声明独立地与引用源进行测试,以避免因部分支持而产生的误报。
在生成后实施专门的「引用门控」。
不应依赖生成模型的自我评估,而应有一个独立的验证步骤来检查源 ID、版本和语义支持。对于事实性内容可使用确定性规则,对于描述性声明可使用 NLI/LLM 裁判,从而确保证据真正支持陈述。
测试证据强度和确定性,而不仅仅是主题相关性。
当弱相关的源支持夸大的声明时(例如将「可能减少时间」变为「将减少 40% 的时间」),就会发生引用洗白。评估者必须检查数字、日期、条件和情态动词,以确保声明的范围与证据相符。
💬 Key Quotes
这是一种危险的失败类型,因为响应看起来是可验证的。
引用不仅仅是格式问题。它是声明与证据片段之间的契约。
这种失败有时被称为引用洗白:相关的源使得夸大的声明看起来可信。
我的评估之所以通过,是因为它检查了系统能否找到正确的文档,而不是能否证明正确的事实。
📊 Article Meta
AI Screening: 86
Source: DEV Community: machinelearning
Author: Paul-S
Category: 人工智能
Language: 英文
Read Time: 4 min
Word Count: 771
Tags:
AI 与智能应用 , RAG / 检索增强 , 模型评测与基准 , LLM 推理优化 , 测试与质量
点赞,必须点赞
整理得太全面了,省了我不少时间。
赞同,实践出真知。