GitHub - samuelrojas-dev/agent-cost-bench: 针对工具型 LLM 智能体的可复现钱包耗尽攻击(DoW)基准测试,基于提供商计费 Token/美元进行评分

林知秋AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-10-02133 阅读💛 241 收藏
GitHub - samuelrojas-dev/agent-cost-bench: 针对工具型 LLM 智能体的可复现钱包耗尽攻击(DoW)基准测试,基于提供商计费 Token/美元进行评分

📌 One-Sentence Summary

agent-cost-bench 是一款旨在通过扫描工具定义中的成本放大模式,在无需 API 密钥的情况下基准测试并保护 LLM 智能体免受钱包耗尽攻击的工具。

📝 Summary

该提供了一个识别 LLM 智能体中可能导致钱包耗尽(DoW)攻击漏洞的框架。它分析工具 Schema 来寻找如无限循环、无限制获取结果或递归输出反馈等会导致成本膨胀的模式。该工具使用模拟提供商离线运行,可以模拟攻击场景而无需 API 密钥也不会产生费用。开发人员证明,“result_cap”是最有效的防御手段,能够在对良性任务仅产生 1.1% 开销的情况下,中和高达 8 倍的成本放大。

💡 Main Points

识别钱包耗尽(DoW)漏洞

该工具扫描工具定义中允许攻击者膨胀成本的模式,例如无限制的结果或工具调用循环。

离线且免费的分析

通过使用模拟提供商并分析 JSON Schema,开发者可以在不使用 API 密钥或花费 Token 费用的情况下测试智能体安全成本风险。

result_cap 防御的有效性

测试表明,对工具结果实施限制是主要的防御措施,能够在对正常操作性能/成本影响极小的情况下,阻止 8 倍的成本增加。

CI/CD 集成

该工具包含 Way Action,如果拉取请求引入了高风险的成本放大模式,它可以导致构建失败。

💬 Key Quotes

攻击者是否能让你的 LLM 智能体产生自己的账单?

扫描你的工具并找出答案——离线操作,无需 API 密钥。

扫描告诉你哪些模式是有风险的;基准测试则是如何衡量这些的。

未发现问题并不代表安全;扫描只检查已知的模式。

📊 Article Meta

AI Screening: 86

Source: Hacker News - Newest: "LLM"

Author: sarojas123

Category: 人工智能

Language: 英文

Read Time: 13 min

Word Count: 3062

Tags:

AI 与智能应用 , AI Agent , 开源项目 , 大语言模型 (LLM) , AI 安全与对齐

#AI 与智能应用# AI Agent# 开源项目# 大语言模型 (LLM)# AI 安全与对齐

文章评论(7)

白向阳2 小时前

路过

回复
云逐月4 小时前

实测过类似工具,作者说的基本属实。

回复
南山客2 小时前

赞同,实践出真知。

回复
空向阳2 小时前

写得挺用心的,支持一下。

回复
墨向阳3 小时前

内容翔实,正好需要,先收藏再看。

回复
逐光而行1 小时前

看完了,收获满满,期待更多更新。

回复
杨丽华1 小时前

实话,说的不明不白

回复