智能体安全实战指南:让 AI 工作流更安全更私密的七道防线
智能体 AI 已是生产基础设施,它的安全模型还不是。
带工具访问、代码执行和长程自主能力的 AI 智能体,正以快于安全团队适应的速度被部署进生产环境。与聊天式 LLM 不同,这些智能体可以读文件、调 API、执行 shell 命令、安装软件包、发起 HTTP 请求,而无需人类逐步监督。安全后果是结构性的:每一项让智能体有用的能力,都以现有控制手段未设计应对的方式扩大攻击面。
三个因素把智能体安全与此前的一切区分开来。第一,智能体在运行时从可能被攻击者控制的输入生成并执行新代码——指令集在部署时并不固定。第二,智能体对工具调用和资源使用做自主决策,静态策略无法预见。第三,智能体维护有状态的内存,可被跨会话操纵。这些因素制造的失败模式,传统 API 安全、Web 应用防火墙和网络边界控制无法可靠阻止。
行业反应迅速。OWASP 于 2025 年 12 月发布了首个智能体应用 Top 10。NSA 发布了面向 AI 驱动自动化(依托 MCP)的安全设计考量。NIST 发布了强化 AI 智能体劫持评估的指引,并于 2026 年初启动 AI 智能体标准倡议。VentureBeat 2026 年 6 月 Pulse 调研(n=107 家企业)发现,54% 的企业已经历过智能体安全事件或未遂事件。但同一调研发现,只有 32% 的企业给每个智能体配置独立的受限身份,只有 30% 对最高风险智能体做沙箱隔离。
本文检视智能体部署中最重要的安全控制:沙箱与隔离、强制访问控制、审计完整性、最小权限工具访问、开源透明与供应链风险、技能与插件极简主义、MCP 威胁与密钥管理。每一节都呈现来自生产部署、行业框架和学术研究的证据,并以面向今天部署智能体工作负载团队的可行建议收尾。
沙箱:抵御智能体沦陷的强隔离

智能体在无沙箱运行时,以宿主机内核和用户权限运作。一次提示词注入或幻觉命令就成了全主机事件。Rehberger 2024 年针对 Claude Computer Use 演示的攻击链——恶意网页投递提示词注入载荷,诱导 Claude 下载并执行二进制文件——证明对无沙箱智能体的提示词注入可以一次尝试就成功;完整利用链需要一些迭代(Claude 起初阻止了直接 bash 下载),攻击者转向用 Firefox 完成下载后得手。
沙箱通过在智能体动作与宿主机资源之间引入独立控制层来应对。三种主流隔离方法在安全-性能光谱上占据不同位置。
基于容器的隔离(Docker 或 Podman 加加固配置)是最低可行沙箱。标准容器通过 Linux 命名空间和 cgroup 共享宿主机内核,这使它们快(毫秒级启动、CPU 开销低于 2%)但也意味着内核漏洞利用可实现逃逸。加固基线包括 —network=none、—cap-drop=ALL、—security-opt=no-new-privileges、只读根文件系统、seccomp 配置和 AppArmor 或 SELinux 策略。两个有据可查的 runc CVE——CVE-2019-5736 和 CVE-2024-21626——证明容器逃逸不是理论。对经过人工审查的可信内部自动化,加固容器可能足够;对不可信代码执行,则不够。
gVisor 提供用户态内核(Sentry),在系统调用到达宿主机内核前逐一拦截。不是数百个系统调用直通宿主机,gVisor 只放行最小的审查子集。官方性能指南确认:CPU 密集型负载开销极小,系统调用密集型负载成本更高(取决于平台选择,KVM 平台提供低开销的系统调用拦截)。gVisor 通过 nvproxy 支持 GPU 负载,开销可忽略。Modal Labs 的多租户沙箱基础设施跑在 gVisor 上。性能成本依负载而定:计算密集任务接近零,I/O 或系统调用密集负载开销更高。
Firecracker microVM 通过基于 KVM 的虚拟机提供硬件级隔离,每个跑自己的 Linux 内核。一台 microVM 125 毫秒内启动、内存开销低于 5MB,单台宿主机每秒可创建最多 150 台 microVM。Firecracker 驱动着 AWS Lambda 和 AWS Fargate,是生产验证最充分的 microVM 技术。攻击面极小:Firecracker 只暴露 6 个模拟设备(QEMU 是数百个),5 万行 Rust 代码库降低了内存安全漏洞风险。E2B 提供专为 AI 智能体构建的托管 Firecracker 沙箱,冷启动低于 100ms,带智能体原生 API。
隔离技术的选择取决于威胁模型。多租户智能体执行或不可信代码,microVM 是唯一安全默认。不需要完整虚拟机隔离的计算密集负载,gVisor 提供强有力的中间地带。人工审查过代码的可信内部自动化,带 seccomp 和 AppArmor 的加固容器足够。三者的共同模式是纵深防御:隔离边界、资源限制、网络控制、权限范围和监控必须全部到位,因为没有任何单一控制是最后防线。
Maiti(2026)演示了在医疗环境中用 Kubernetes 上的 gVisor 部署九个自主 AI 智能体,内核级隔离是四层防御的第一层。90 天运行(记录于 arXiv 预印本)中,该架构把全部智能体执行约束在 gVisor 沙箱内,一个自动化安全审计智能体发现并修复了四个 HIGH 级别问题。
MAC 与 ACL 系统在智能体基础设施中使用不足

强制访问控制(MAC)系统——SELinux、AppArmor、seccomp——已是 Linux 安全的一部分超过二十年,但它们在智能体工作负载上的应用仍然罕见。VentureBeat 调研发现只有 30% 的企业对最高风险智能体做沙箱,员工超 1000 人的组织中隔离率降到 20%。多数部署依赖提供商原生护栏(提示词与输出过滤器)——评估一次调用「看起来」是否恶意,而非约束智能体实际能做什么。
CrowdStrike CTO Elia Zaitsev 把区别说得很清楚:观察实际的「动能」动作是一个结构化、可解决的问题;意图不是。MAC 系统解决动能层——强制规定智能体能执行哪些操作,无论智能体的意图或提示词内容是什么。
对基于容器的智能体部署,标准 MAC 栈包括:限制可用系统调用的 seccomp 配置、约束文件访问和网络操作的 AppArmor 配置、移除特权操作的 capability 丢弃。面向智能体工作负载的加固 Docker 配置会丢弃全部 capabilities、应用严格 seccomp 配置、启用 no-new-privileges、以只读挂载文件系统。这些控制阻止最常见的容器逃逸路径,并限制智能体沦陷时的爆炸半径。
Kubernetes 层面,NetworkPolicy 资源提供网络层 MAC:把出口流量限制到白名单目的地、入口流量限制到授权来源。Maiti 部署用 Kubernetes NetworkPolicy 强制每个智能体只能与其白名单 API 端点通信,阻止通过未授权网络路径的数据外传。
MAC 控制的低使用率反映了一个全行业缺口:事件数据回报最高的控制——受限身份与隔离——恰恰是默认提供商栈不包含的两项。部署智能体的组织应把 MAC 配置视为先决条件,而非优化项。
最小权限意味着工具级 ACL,不只是文件系统权限

智能体的最小权限运行在比传统 IAM 更细的粒度上。一个智能体需要的不只是文件系统权限,而是工具级访问控制:它能调哪些工具、带什么参数、在什么条件下。MCP 的安全最佳实践明确服务器应当实现渐进式最小权限范围模型:初始范围集只含低风险的发现和读操作,当特权操作被尝试时通过定向范围挑战增量提升。
MCP 规范的范围最小化指南警告:不要把所有可能的范围都发布在 scopes_supported 里;不要用通配符或全能范围(*、all、full-access);不要捆绑无关权限来预防未来的提示;不要把令牌中声明的范围当作充分条件而不做服务器端授权逻辑。这些不是理论担忧。VentureBeat 调研发现 69% 的企业在部署中某处存在凭据共享,只有 32% 给每个智能体独立的受限托管身份。
解决这一缺口的经济激励在并购市场清晰可见。Palo Alto Networks 于 2026 年 2 月完成对 CyberArk 的 211 亿美元收购。CrowdStrike 以 7.4 亿美元收购 SGNL,并于 2026 年 6 月前发布了 Continuous Identity for AI Agents——基于归属者、调用者和设备风险态势实时验证每个智能体动作的产品。Cisco 宣布以约 4 亿美元收购非人类身份专家 Astrix Security。
这些收购瞄准一个结构性问题:身份共享时,归因失败。共享凭据上的单个沦陷智能体继承了该密钥触及的每个工作流累积的权限,取证线索在凭据层面中断。修复是每会话凭据范围化加短生命周期令牌,把每个凭据绑定到特定智能体、任务和时间窗。
审计完整性必须捕获意图,不只是系统调用

智能体审计轨迹必须捕获三层:智能体被要求做什么(提示词或目标)、它调用了哪些工具带什么参数、产生了什么结果。仅有系统级日志——进程执行、网络连接、文件访问——缺少判断一个动作是授权还是恶意的语义上下文。提示词注入导致的 rm -rf 与合法清理任务的 rm -rf,在内核审计日志里一模一样。
OWASP 智能体 AI Top 10 把「内存与上下文投毒」(ASI06)列为独立风险类别:攻击者污染智能体的持久内存后,可跨会话影响未来行为而不触发任何传统安全告警。检测这需要把智能体动作与预期行为模式对比的审计系统,而不只是静态白名单。
Qi 等(2026)的 arXiv 综述把评估统一到一个强调过程信号、约束违规、轨迹完整性与对抗成功率(与结果指标并列)的框架。这呼应了 CrowdStrike Falcon 传感器的做法:在端点上遍历进程树,追踪智能体实际做了什么,而非它们看起来想做什么。
对 MCP 部署,云安全联盟的 MCP 安全工作组建议对每次工具调用、每次参数变更、每次 schema 更新做全面日志,配不可变审计轨迹和对异常网络连接或过量 API 调用的异常检测。Security Boulevard 的 MCP 防御框架建议把 MCP 流量当作高价值网络遥测对待,用安全代理中间层在转发给 MCP 服务器前记录每次工具调用。
开源智能体提供透明度,但扩大供应链风险

开源智能体框架使社区安全审计成为专有系统无法匹配的现实。整个工具调用机制、提示词构建管线和内存管理系统都可供检查。Caging the Agents 架构把全部 Kubernetes 配置、审计工具和提示词完整性框架以开源发布。CSA MCP 安全项目维护审计发现和漏洞报告的社区数据库。
但开源智能体框架也通过插件生态、MCP 服务器注册表和包依赖扩大攻击面。OX Security 的分析识别出 Anthropic MCP 核心中的「AI 供应链之母」——一个关键系统性脆弱点:MCP 的即插即用架构为整个智能体工具生态制造了单点故障。Qi 等(2026)的调查研究了智能体技能中的安全漏洞,发现技能与插件模型引入了与 npm 和 PyPI 生态类似的依赖供应链风险,且增添了技能可在运行时修改智能体行为的危险。
野外首个恶意 MCP 服务器 2025 年 9 月出现在 npm 上,冒充 Postmark 的邮件服务。它作为合法邮件 MCP 服务器运作,但暗中将每封外发邮件密送给攻击者。后续发现的一个 MCP 服务器带双反向 shell——一个在安装时触发、一个在运行时触发——且恶意代码在每次 npm install 时重新下载,而非静态可检测。
这些事件验证了 OWASP 智能体 AI 风险类别 ASI04「供应链漏洞」——专门针对被入侵的 MCP 服务器、插件和外部智能体。建议的缓解包括:验证来源、优先选用已知发布者的签名包、清点智能体使用的每个 MCP 服务器和插件、把每次插件添加视为智能体安全态势的重大变更。
每个技能和插件都是有 CVE 潜力的依赖

技能与插件极简主义是从软件供应链安全借来的实践:每个插件都增加运行在智能体上下文中的代码、访问智能体内存、可代智能体调用工具。插件越多,攻击面越大,需要审查的依赖越多。
OWASP 智能体 Top 10 把供应链漏洞(ASI04)列为独立风险类别,反映行业对插件生态是主要攻击向量的认知。OWASP 利用追踪器引用的真实事件——Postmark MCP 冒充、双反向 shell MCP 服务器、PhantomRaven 调查发现的 126 个恶意 npm 包——共享一个模式:攻击者利用了插件或包「声称做什么」与「实际做什么」之间的缺口。
OWASP 与 CSA MCP 安全项目的共同建议是:维护每个插件、技能和 MCP 服务器的严格清单,按来源、维护状态和权限范围做风险评分。Enkrypt AI 的 MCP Scanner 和 Adversa AI 的漏洞分类法都为这一审计过程提供工具,跨 25 个类别分类漏洞,包括工具投毒、schema 操纵和供应链颠覆。
MCP 引入无先例可循的新型攻击类

模型上下文协议(MCP)被广泛用于连接 AI 智能体与工具和数据源——Microsoft、Anthropic、OpenAI 和 Google 都支持——但该协议的架构引入了把它当作普通 API 集成无法应对的安全挑战。
Adversa AI 的 MCP 安全 Top 25 分类法把提示词识别为最高风险漏洞(Critical,10/10,可利用性极低门槛),其后是命令注入(Critical,10/10)、工具投毒(Critical,9/10)和远程代码执行(Critical,10/10)。该分类区分三类:传统软件不存在的 AI 特有漏洞(提示词注入、工具投毒)、传统应用安全弱点(SQL 注入、命令注入),以及 MCP 架构独有的漏洞(工具投毒、完整 schema 投毒)。
MCP 安全规范中记录的「困惑代理人」(confused deputy)攻击,利用连接第三方 API 的 MCP 代理服务器。当代理服务器对第三方授权服务器使用静态 client ID 时,攻击者可构造恶意授权请求,利用先前设置的同意 cookie 绕过同意页面,MCP 代理服务器随后把授权码投递给攻击者的重定向 URI 而非合法客户端。此攻击需要特定条件(静态 client ID、动态客户端注册、同意 cookie),但这些条件描述的正是许多 MCP 部署的默认配置。
NSA 关于 MCP 安全设计考量的网络安全信息表强调:组织必须为 MCP 部署从零开始重新思考信任与认证。该协议创建了让智能体通过一个标准化接口触达多样数据源的通用连接器,但集中化这些通路也制造了高价值目标。一个沦陷的 MCP 服务器危害的不是单个工具,而是通向整个运营架构的桥梁。
CSA MCP 安全项目的加固指南推荐四大支柱:来源验证、隔离边界、流量中介和运行时监控。Security Boulevard 的框架补充:MCP 安全代理应作为强制中间层坐在智能体与 MCP 服务器之间,执行策略、验证 schema、做实时授权检查、在恶意载荷到达 LLM 上下文窗口前剥离它们。
密钥管理必须从共享密钥走向每会话身份

共享 API 密钥是智能体部署中最常见的凭据模式,也是最危险的。VentureBeat 2026 年 6 月对 107 家企业的 Pulse 调研发现:69% 在部署中某处共享凭据运行智能体,只有 32% 给每个智能体独立的受限托管身份。同一调研发现 82% 的受访者依赖提供商原生或超大规模云控制作为单一主要智能体安全层——免费捆绑、默认开启的提示词与输出过滤器,但不给智能体自己的身份,也不做沙箱。
结构性问题在于:共享凭据把单个沦陷智能体变成多个。CyberArk 的研究给出全球组织中机器身份与人类之比为 82:1,智能体是增长最快的类别。身份共享时,归因与遏制双双失败:取证轨迹无法确定哪个智能体做了什么,吊销共享凭据会中断依赖它的每个工作流。
这一领域的收购活动——Palo Alto 买 CyberArk(211 亿美元)、CrowdStrike 买 SGNL(7.4 亿美元)、Cisco 买 Astrix(4 亿美元)——标志着行业预期身份层将成为智能体 AI 的决定性安全战场。这些收购瞄准免费控制(提示词过滤器、输出护栏)与真正有效的归因控制(受限身份、隔离)之间的缺口。
Maiti 医疗部署(2026 年 arXiv 预印本)使用凭据代理边车,阻止智能体容器访问原始密钥。不是把 API 密钥嵌入智能体配置或环境变量,而是边车代理代智能体认证,仅在需要时注入短生命周期、受限范围的令牌。这一从服务网格架构借来的模式,确保智能体永不持有长期密钥,且每个凭据绑定到特定智能体身份。
默认控制与有效控制之间的缺口是行业的中心问题

VentureBeat 调研数据揭示一致模式:部署最广的控制是随模型提供商免费附送的(提示词过滤器、输出护栏),而真正遏制损害的控制——受限身份、沙箱隔离、运行时监控——部署率低于 50%。缺口随企业规模扩大:事件率从 101-1000 人公司的 49% 升至 1000 人以上公司的 63%,沙箱隔离从 35% 降到 20%。5000 人以上的组织,事件率与隔离覆盖之间的缺口达到 60 个百分点。这些子组数据来自 107 个受访者的样本,应视为方向性而非决定性。
并购与初创活动的经济逻辑指向这一缺口。Palo Alto、CrowdStrike 和 Cisco 都定位于随智能体部署规模化销售身份层控制,提供专为智能体身份、隔离和审计构建的产品。
对今天部署智能体的组织,前行之路是分层的:用 microVM 或 gVisor 隔离执行环境;通过 MCP 范围最小化执行工具级 ACL;在代理层审计每次工具调用;签发每智能体短生命周期凭据;维护插件、技能和 MCP 服务器的严格清单;把智能体安全当作基础设施安全而非 AI 安全。
没有任何单一控制能替代其他控制,而默认的提供商栈是不够的。
原文信息
- 作者:Mayhem4Markets(@Mayhem4Markets),AI 基础设施技术分析
- 发布时间:2026-07-13 原文地址:
暂无评论,快来抢沙发~