GitHub - samuelrojas-dev/agent-cost-bench: 针对工具型 LLM 智能体的可复现钱包耗尽攻击(DoW)基准测试,基于提供商计费 Token/美元进行评分

📌 One-Sentence Summary
agent-cost-bench 是一款旨在通过扫描工具定义中的成本放大模式,在无需 API 密钥的情况下基准测试并保护 LLM 智能体免受钱包耗尽攻击的工具。
📝 Summary
该提供了一个识别 LLM 智能体中可能导致钱包耗尽(DoW)攻击漏洞的框架。它分析工具 Schema 来寻找如无限循环、无限制获取结果或递归输出反馈等会导致成本膨胀的模式。该工具使用模拟提供商离线运行,可以模拟攻击场景而无需 API 密钥也不会产生费用。开发人员证明,“result_cap”是最有效的防御手段,能够在对良性任务仅产生 1.1% 开销的情况下,中和高达 8 倍的成本放大。
💡 Main Points
识别钱包耗尽(DoW)漏洞
该工具扫描工具定义中允许攻击者膨胀成本的模式,例如无限制的结果或工具调用循环。
离线且免费的分析
通过使用模拟提供商并分析 JSON Schema,开发者可以在不使用 API 密钥或花费 Token 费用的情况下测试智能体安全成本风险。
result_cap 防御的有效性
测试表明,对工具结果实施限制是主要的防御措施,能够在对正常操作性能/成本影响极小的情况下,阻止 8 倍的成本增加。
CI/CD 集成
该工具包含 Way Action,如果拉取请求引入了高风险的成本放大模式,它可以导致构建失败。
💬 Key Quotes
攻击者是否能让你的 LLM 智能体产生自己的账单?
扫描你的工具并找出答案——离线操作,无需 API 密钥。
扫描告诉你哪些模式是有风险的;基准测试则是如何衡量这些的。
未发现问题并不代表安全;扫描只检查已知的模式。
📊 Article Meta
AI Screening: 86
Source: Hacker News - Newest: "LLM"
Author: sarojas123
Category: 人工智能
Language: 英文
Read Time: 13 min
Word Count: 3062
Tags:
AI 与智能应用 , AI Agent , 开源项目 , 大语言模型 (LLM) , AI 安全与对齐
路过
实测过类似工具,作者说的基本属实。
赞同,实践出真知。
写得挺用心的,支持一下。
内容翔实,正好需要,先收藏再看。
看完了,收获满满,期待更多更新。
实话,说的不明不白