BMW Group 如何在 14,000 个云账户中检测成本异常 | Amazon Web Services

溪行者AI 前沿📡 BestBlogs·AI高分精选⭐ 872026-09-22309 阅读💛 185 收藏
BMW Group 如何在 14,000 个云账户中检测成本异常 | Amazon Web Services

📌 One-Sentence Summary BMW Group 实施了云效率分析系统 (CLEA),这是一个使用 Meta Prophet 的无服务器 FinOps 系统,通过多层过滤机制在 14,000 个云账户中检测成本异常并最大限度地减少误报。 📝 Summary BMW Group 开发了云效率分析系统 (CLEA),旨在将 14,000 个云账户的成本管理从被动的仪表盘监控转变为主动的异常检测。该系统利用 Meta 的 Prophet 库,基于 365 天的历史数据为每个「账户-服务」组合创建独立的成本基准线。为了确保告警具有可操作性并减少噪音,CLEA 采用了三级过滤漏斗:首先通过置信区间进行统计学异常检测,其次基于账户支出集群设置通用阈值(最小影响范围从 $300 到 $1,000),最后实施特定服务或特定账户的覆盖规则。整个流水线构建在基于 AWS Step Functions、Lambda 和 S3 的无服务器架构上,每天处理数十亿行账单数据,每月成本仅约为 $50。该系统通过 Amazon QuickSight 为账户所有者提供自助式根因分析,允许深入钻取具体操作和使用类型,以快速锁定成本激增的来源。 💡 Main Points 通过 Prophet 实现动态基准预测 CLEA 不使用固定的金额阈值,而是利用 Meta 的 Prophet 为每个「账户-服务」组合建模加法季节性,使系统能够适应数千个不同账户独特的增长和使用模式。 多层噪音削减漏斗 为了防止告警疲劳,系统通过三个阶段过滤异常:统计置信区间、账户集群最小金额影响(以忽略小账户中可忽略的激增),以及针对 AWS Glue 和 Athena 等天然波动服务的特定服务阈值。 高规模无服务器架构 通过在分布式映射模式下利用 AWS Step Functions 以及多达 500 个并发 Lambda 函数,BMW 在 20 分钟内即可处理 14,000 个账户,且每月计算成本极低,约为 $50。 自助式根因分析 (RCA) 系统通过提供仪表盘,允许所有者从高层级告警深入钻取到具体的 AWS 操作和使用类型(例如识别特定的 g6.48xlarge 实例),从而弥补了检测与判断之间的差距。 💬 Key Quotes 像「每日支出超过设定金额即告警」这样的固定规则,在这种规模下是行不通的。 CLEA 学习每个「账户-服务」组合的轨迹,因此对比的是该组合的实际行为,而非一个由中心统一选定的数字。 检测与判断之间的界限是永久存在的,因此我们根据用户反馈来调整阈值,而不是试图通过工程手段将其完全消除。 整个周期在 20 分钟内完成,整个架构每月的计算成本约为 $50,即每个账户每月成本不到半美分。 📊 Article Meta AI Screening: 87 Source: AWS Artificial Intelligence Author: Tareq Haschemi Category: 商业科技 Language: 英文 Read Time: 11 min Word Count: 2671 Tags: 商业与创业 , 性能优化 , 云原生 / DevOps , AI 工程 , 系统设计 Read Full Article

#商业与创业# 性能优化# 云原生 / DevOps# AI 工程# 系统设计

文章评论(0

暂无评论,快来抢沙发~