Amazon SageMaker HyperPod Inference Gateway 正式发布 | Amazon Web Services

📌 One-Sentence Summary AWS 推出了 Amazon SageMaker HyperPod Inference Gateway,这是一个 Kubernetes 原生的 GPU 感知路由系统,通过利用实时指标消除轮询瓶颈并降低首字延迟,从而优化 LLM 推理。 📝 Summary 本文介绍了 Amazon SageMaker HyperPod Inference Gateway,这是一种 Kubernetes 原生的 GPU 感知路由解决方案,旨在克服大规模 LLM 部署中默认轮询负载均衡器的局限性。该系统基于 Gateway API Inference Extension 构建,采用两层架构:第一层(Tier 1)是由 EKS 管理的集群网关,包含 Envoy Gateway、基于正文的路由器(BBR)和端点选择器(EPP);第二层(Tier 2)计划引入全局路由器。EPP 通过消费 Prometheus 的实时指标(如 KV 缓存利用率、队列深度、LoRA 常驻情况和前缀缓存命中率)来实现智能请求路由。针对不同规模模型(8B 至 235B 参数)的基准测试表明,在混合 GPU 代际、突发流量和共享提示词前缀等实际场景下,该方案在无需修改应用代码的情况下,显著提升了 P95/P99 首字延迟(TTFT)和吞吐量。 💡 Main Points 默认 Kubernetes 路由的局限性 标准的轮询(Round-robin)和最小连接数负载均衡器缺乏对 GPU 内部状态的可见性,导致请求在繁忙的 Pod 上堆积,而空闲容量却未被利用,从而引发延迟峰值。 两层 GPU 感知路由架构 第一层作为 EKS 管理的插件部署,结合了用于 L7 代理的 Envoy Gateway、用于解析 OpenAI 兼容请求的基于正文的路由器(BBR),以及由 Prometheus 实时指标驱动的端点选择器(EPP)。 多信号智能调度 EPP 利用 KV 缓存利用率、队列深度、LoRA 适配器常驻情况和前缀缓存命中率等因素优化放置策略,将请求引导至处理能力最强的 Pod。 生产压力下的量化性能提升 基准测试显示,在混合 GPU 代际、突发流量和共享提示词前缀等非均匀场景下,P95/P99 TTFT 最高可降低 97%-98%,吞吐量最高可提升 50%。 💬 Key Quotes 一名等待首字 4.4 秒的聊天机器人用户,现在可以在 800 毫秒内看到结果。 Inference Gateway 并不是一个与 Kubernetes 并行部署的独立平台,它就是 Kubernetes。 📊 Article Meta AI Screening: 90 Source: AWS Artificial Intelligence Author: Vinay Arora Category: 人工智能 Language: 英文 Read Time: 7 min Word Count: 1742 Tags: AI 与智能应用 , 模型训练与推理 , 云原生 / DevOps , 性能优化 , AI 工程 Read Full Article
暂无评论,快来抢沙发~