确保来源正确,而不仅仅是事实:面向 MCP 智能体的来源感知验证

📌 One-Sentence Summary
作者推出了 ProvenanceGuard,这是一个针对基于 MCP 的大语言模型智能体的来源感知验证层,通过确保声明归属于正确的特定工具输出而非仅存在于证据池中,从而防止「跨来源混淆」。
📝 Summary
ProvenanceGuard 解决了当前大语言模型事实性检查器中的一个关键缺口:未能区分事实是否存在于证据池中与事实是否归属于正确来源。在使用模型上下文协议(MCP)的多工具环境中,智能体经常混淆来源(例如,将政策事实错误地归因于患者记录)。ProvenanceGuard 作为一个生成后处理层运行,它将答案分解为声明,将其路由到最相关的来源,通过自然语言推理(NLI)验证支持情况,并检查归属准确性。在医疗智能体轨迹上的测试表明,与 RAGAS 和 MiniCheck 等忽略来源的基线方法相比,它在拦截错误声明方面表现更优,同时保持了适合数据敏感领域的保守安全配置。
💡 Main Points
识别出「跨来源混淆」作为一种独特的失败模式。
传统的验证器会汇集所有检索到的证据,即使智能体将声明错误地归因于其他来源,只要该声明在某个地方是真实的,就会通过验证,这在临床或金融场景中是非常危险的。
实施非侵入式的生成后验证流程。
ProvenanceGuard 通过分析 MCP 轨迹在黑盒智能体上运行,利用一系列步骤包括声明分解、来源路由(使用 MiniLM)、NLI 验证(使用 DeBERTa)以及归属检查,且无需重新训练智能体。
在检测归属错误和无支持声明方面具有高精度。
在医疗测试中,它捕获了专家标记为错误的 139 个声明中的 138 个,并成功检测出 100% 的故意来源交换错误。
集成针对被拦截答案的 RARR 风格修复循环。
当声明被拦截时,系统可以触发基于来源的修订或安全回退机制,确保最终输出要么经过验证,要么被明确标记为不可验证。
💬 Key Quotes
忽略来源的验证器可能会通过它,因为该事实确实存在于证据池中。但具备来源感知的验证器不应如此。
在某处得到支持并不等同于由正确的来源提供支持。
在数据敏感的环境中,错误的归属可能与错误的事实一样具有破坏性。
ProvenanceGuard 是一个位于黑盒 MCP 智能体之上的生成后验证层。
📊 Article Meta
AI Screening: 87
Source: Hugging Face - Blog
Author: Antonio Tiene, Ander Alvarez Sanz, Oliver Wirjadi
Category: 人工智能
Language: 英文
Read Time: 6 min
Word Count: 1464
Tags:
AI 与智能应用 , AI Agent , MCP协议 , 模型评测与基准 , 模型训练与推理
支持作者,持续关注中。