确保来源正确,而不仅仅是事实:面向 MCP 智能体的来源感知验证

星海拾光AI 前沿📡 BestBlogs·AI高分精选⭐ 872026-09-29146 阅读💛 231 收藏
确保来源正确,而不仅仅是事实:面向 MCP 智能体的来源感知验证

📌 One-Sentence Summary

作者推出了 ProvenanceGuard,这是一个针对基于 MCP 的大语言模型智能体的来源感知验证层,通过确保声明归属于正确的特定工具输出而非仅存在于证据池中,从而防止「跨来源混淆」。

📝 Summary

ProvenanceGuard 解决了当前大语言模型事实性检查器中的一个关键缺口:未能区分事实是否存在于证据池中与事实是否归属于正确来源。在使用模型上下文协议(MCP)的多工具环境中,智能体经常混淆来源(例如,将政策事实错误地归因于患者记录)。ProvenanceGuard 作为一个生成后处理层运行,它将答案分解为声明,将其路由到最相关的来源,通过自然语言推理(NLI)验证支持情况,并检查归属准确性。在医疗智能体轨迹上的测试表明,与 RAGAS 和 MiniCheck 等忽略来源的基线方法相比,它在拦截错误声明方面表现更优,同时保持了适合数据敏感领域的保守安全配置。

💡 Main Points

识别出「跨来源混淆」作为一种独特的失败模式。

传统的验证器会汇集所有检索到的证据,即使智能体将声明错误地归因于其他来源,只要该声明在某个地方是真实的,就会通过验证,这在临床或金融场景中是非常危险的。

实施非侵入式的生成后验证流程。

ProvenanceGuard 通过分析 MCP 轨迹在黑盒智能体上运行,利用一系列步骤包括声明分解、来源路由(使用 MiniLM)、NLI 验证(使用 DeBERTa)以及归属检查,且无需重新训练智能体。

在检测归属错误和无支持声明方面具有高精度。

在医疗测试中,它捕获了专家标记为错误的 139 个声明中的 138 个,并成功检测出 100% 的故意来源交换错误。

集成针对被拦截答案的 RARR 风格修复循环。

当声明被拦截时,系统可以触发基于来源的修订或安全回退机制,确保最终输出要么经过验证,要么被明确标记为不可验证。

💬 Key Quotes

忽略来源的验证器可能会通过它,因为该事实确实存在于证据池中。但具备来源感知的验证器不应如此。

在某处得到支持并不等同于由正确的来源提供支持。

在数据敏感的环境中,错误的归属可能与错误的事实一样具有破坏性。

ProvenanceGuard 是一个位于黑盒 MCP 智能体之上的生成后验证层。

📊 Article Meta

AI Screening: 87

Source: Hugging Face - Blog

Author: Antonio Tiene, Ander Alvarez Sanz, Oliver Wirjadi

Category: 人工智能

Language: 英文

Read Time: 6 min

Word Count: 1464

Tags:

AI 与智能应用 , AI Agent , MCP协议 , 模型评测与基准 , 模型训练与推理

#AI 与智能应用# AI Agent# MCP协议# 模型评测与基准# 模型训练与推理

文章评论(1)

星观澜23 分钟前

支持作者,持续关注中。

回复