生产环境中的 LLM 推理路由:从引擎信号到策略

📌 One-Sentence Summary OpenAI 推理工程师 Lu Zhang 与 Qianru Lao 介绍 IRB 如何从反馈环负载均衡器演进为控制面与数据面架构,并通过全局优化器在容量、健康度和缓存约束下分配路由权重,以降低端到端延迟并保持生产稳定性。 📝 Summary Lu Zhang 与 Qianru Lao 介绍 OpenAI 的推理负载均衡器 IRB。它位于 CPU 前端集群与多区域 GPU 引擎集群之间,需要在 TTFT、TBOT、健康度、利用率和 KV Cache 本地性等约束下选择引擎。早期路由采用加权一致性哈希,权重来自类似 P 控制器的周期性反馈环:性能优于集群平均水平的引擎会获得更高权重,受限引擎的流量也会自动重新平衡。但这种适应性方案难以解释和调试,与异构 GPU SKU 的组合效果不佳,还会产生破坏 KV Cache 复用的振荡。重设计后的系统将全局视图交给控制面,将基于异步刷新本地路由权重的选路交给数据面。面对异构容量和地域需求失衡,轮询与仅选最近引擎的策略都会失效;一个 RPS 案例表明,把请求发送到更远但有余量的引擎,可能比在过载的邻近引擎后排队更快。优化器根据需求、网络延迟、容量、健康度以及 TTFT 和 TBOT 负载曲线,最小化预期端到端延迟,同时满足完整承接需求、容量上限和权重非负等约束。生产保护机制包括对异常值引擎施加惩罚、设置动态重试预算以避免重试风暴,以及主动削减过量流量,让系统能够平稳降级。 💡 Main Points IRB 必须同时考虑延迟、健康度、本地性与 KV Cache 与通用负载均衡器不同,IRB 在多区域 GPU 引擎之间进行路由,同时参考 TTFT、TBOT、利用率和会话亲和性,让后续轮次复用已缓存的上下文,而不是重新计算。 反馈环加权具备适应性,却会振荡且难以调参 类似 P 控制器的反馈环会提高性能优于集群平均水平的引擎权重,并自动平衡受限流量;但混杂的信号让决策缺乏透明度,流量来回抖动还会让引擎先冷却再升温,损害 KV Cache 本地性。 控制面负责全局优化,数据面负责快速本地决策 控制面把实时信号与离线容量、延迟回归模型合并为路由权重快照;数据面使用最新的本地快照和健康度保护机制完成选路,不会让每个请求都等待控制面。 需求与 GPU 容量不均衡时,仅选择最近引擎会失效 一个 RPS 案例显示,当某区域有 120 的需求而本地容量只有 100 时,应把部分流量溢出到拥有余量的远端引擎,因为增加一次网络跳转可能仍比在过载邻居后排队更快。 惩罚、受限重试与负载削峰维持生产稳定 异常值引擎会被降低权重,以便恢复或维修;动态重试预算可在高负载下避免重试风暴;负载削峰则丢弃超出承载能力的需求,使整个集群平稳降级,而不是引发级联故障。 💬 Key Quotes 「性能、可靠性、本地性与缓存感知的结合,正是这个问题如此有趣的原因。」 「反馈环也可能制造糟糕的振荡:当你把流量从某个引擎移走,它会冷却下来;这个信号反馈给控制器后,控制器又认为该引擎可以承接更多流量,于是流量在少数引擎之间来回切换,破坏 KV Cache 的利用率。」 「因此,我们需要一个全局优化的方案:控制面掌握所有 CPU 集群和 GPU 引擎的全局视图,计算全局最优的路由结果;数据面则根据控制面提供的结果快速做出路由决策。」 「更远的引擎可能带来更快的端到端体验。」 「与其让整个系统失败,不如主动削减一部分流量,让系统平稳降级。」 📊 Article Meta AI Screening: 90 Featured: Yes Source: AI Engineer Author: AI Engineer Category: 人工智能 Language: 英文 Read Time: 9 min Word Count: 2049 Tags: AI 与智能应用 , LLM 推理优化 , KV Cache优化 , 大语言模型 (LLM) , AI 硬件与芯片 Play Full Video
暂无评论,快来抢沙发~