OpenRouter Guardrails 护栏配置:预算限额、零数据保留、提示注入防御与 DLP 五合一治理
一句话结论

智能体跑飞、API 密钥烧钱、敏感数据流向第三方日志——这三类事故在多模型调用场景里最常见。OpenRouter 工作区护栏(Guardrails)把五类治理规则集中到一个可配置对象:预算执行、零数据保留与模型限制、提示注入防御、数据防泄漏(DLP),以及按 API 密钥或成员分配策略。规则在工作区层强制生效,不需要改任何调用代码。本文按五大能力、生效层次、检测机制与配置路径展开,管理 API 示例可直接复制使用。
预算执行:按实体独立封顶
预算护栏按日、周、月三个重置窗口设置消费上限,超出限额的请求直接返回 402 失败。
关键机制是预算按实体独立计算,不共享。给三名团队成员各分配一条 50 美元/日的护栏,每人拿到的是独立的 50 美元额度。API 密钥预算叠加在成员预算之上:如果 Audrey 的成员上限是 100 美元/日,她某个密钥的上限是 30 美元/日,那么这个密钥最多花 30 美元,Audrey 名下所有密钥合计最多 100 美元,两层在每个请求上同时检查。
这个设计直接解决”一个失控脚本烧光整月预算”的问题——给每个自动化任务分配独立密钥并配上限额,事故范围就被锁死在单密钥内。
零数据保留与模型限制:把流量圈进白名单
ZDR 规则一键禁用所有会保留或用输入数据训练的端点,也可以单独屏蔽某些模型或供应商,或者把整个工作区限制在一份模型/供应商白名单内。
被拦截的请求返回 404。这个能力服务于两类场景:一是合规要求,确保流量只流向通过审查的供应商;二是成本管控,把每个项目锁定在应有的价格档位。
账户级隐私策略和供应商限制默认被继承,护栏只能在此基础上收紧,不能放宽。
提示注入防御:30+ 正则拦截在请求出站前
注入检测扫描输入是否命中 30 多个正则模式,模式库来自 OWASP LLM 提示注入预防速查表等资源,并覆盖常见绕过手法:错字变异、编码绕过、字符间隔绕过。
检测是确定性的,延迟开销可以忽略。关键是检测发生在请求发送给模型供应商之前——被拦截的流量根本不会离开 OpenRouter。对那些把用户输入原样传给智能体的应用,这是出站前的最后一道闸。
检测到模式后可选三种动作:
- 标记(Flag):请求原样放行,检测结果只记录用于观察。适合先评估对正常流量的误伤,再切换到拦截。
- 脱敏(Redact):命中部分被替换为 [PROMPT_INJECTION] 占位符,清洗后的请求继续发给模型。
- 拦截(Block):整个请求在到达模型前以 403 拒绝,响应里附带检测到的模式类型元数据。
从”标记”起步观察一周,再收紧到”脱敏”或”拦截”,是这套机制推荐的落地节奏。
数据防泄漏:七类内置敏感信息检测
DLP 负责检测并处理请求里的个人身份信息(PII)和其他敏感内容。内置七种敏感信息类型,也支持自定义正则来覆盖领域数据(内部项目代号、专有知识产权)。每类都可以配置为脱敏或整单拦截,拦截返回 403 并附检测到的内容类型。
多数内置模式和所有自定义模式用正则匹配,确定性高、延迟可忽略。人名和地址两类走 Presidio NLP 识别,延迟与输入长度成正比:
| 内置模式 | 匹配方法 | 脱敏占位符 |
|---|---|---|
| 电子邮箱 | 正则 | [EMAIL] |
| 电话号码 | 正则 | [PHONE] |
| 社会安全号 | 正则 | [SSN] |
| 信用卡号 | 正则 | [CREDIT_CARD] |
| IP 地址 | 正则 | [IP_ADDRESS] |
| 人名 | NLP | [PERSON_NAME] |
| 地址 | NLP | [ADDRESS] |
对需要把数据合规承诺落实到位的团队,这张表就是配置清单:把高敏项(信用卡、SSN)设为拦截,把低敏项(邮箱、电话)设为脱敏,供应商日志里就不会再出现明文 PII。
分配给 API 密钥或组织成员
护栏可以同时分配给多个 API 密钥或成员。分配给成员时,护栏作用于该成员在工作区的所有密钥。
每个工作区有一条默认护栏,作用于工作区内所有密钥和成员,作为基线;在此之上可以创建更多护栏进一步限制特定密钥或成员,层层叠加。
管理接口与配置示例
入口在工作区控制台的 Workspaces > Guardrails 页面,也可以用管理 API 全量自动化:创建、更新、删除、列出、分配给密钥或成员都支持,适合在团队入职或密钥轮换流程里批量配置。
创建一条护栏的 API 调用示例(限额 100 美元/日、模型白名单、注入拦截、邮箱脱敏、信用卡拦截):
curl https://openrouter.ai/api/v1/guardrails \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"name": "production-safety",
"limit_usd": 100,
"reset_interval": "daily",
"allowed_models": [
"anthropic/claude-sonnet-4.6",
"openai/gpt-5.4",
"google/gemini-3.1-pro-preview"
],
"content_filter_builtins": [
{"slug": "regex-prompt-injection", "action": "block"},
{"slug": "email", "action": "redact"},
{"slug": "credit-card", "action": "block"}
]
}'
这份配置把生产安全的四个关键点一次配齐:日预算上限、模型白名单、注入全拦、邮箱脱敏保留可用性、信用卡号直接拦截。改几个参数就能当作新项目的起步模板。
原文信息
- 作者:OpenRouter(Cailee Moberg)
- 发布时间:2026-05-29
- 原文标题:Guardrails: Protect your Agents, Data, and Costs
原文地址:
暂无评论,快来抢沙发~