在 Amazon EKS 上利用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40% | Amazon Web Services

📌 One-Sentence Summary
AWS 详细介绍了在 Amazon EKS 上使用 DeepEP 和 EFA 扩展 MoE 强化学习的架构,通过优化专家并行通信实现 40% 的吞吐量提升。
📝 Summary
本技术指南探讨了在大规模场景下使用强化学习(RL)对混合专家(MoE)模型进行后训练所面临的基础设施挑战。文章指出了三个关键瓶颈:平衡 rollout 生成与策略训练之间的异构计算、管理加速器之间的高吞吐量通信,以及协调各子系统。所提出的解决方案利用 Amazon EKS 进行编排,使用弹性网络适配器(EFA)实现低延迟的节点间网络通信,并借助 DeepEP 优化专家并行中固有的稀疏 all-to-all 通信模式。通过将 DeepEP 的原语迁移至 libfabric 以原生支持 EFA,AWS 在 P5en 实例上实现了 RL rollout 吞吐量 40% 的提升。此外,文章建议对容错的 rollout worker 使用 EC2 Spot 实例,同时将策略训练保持在稳定容量上,以在不影响稳定性的前提下降低成本。
💡 Main Points
通过 EFA 上的 DeepEP 优化专家并行通信
标准的 NCCL all-to-all 集合通信对于 MoE 模型中稀疏、动态的 token 路由效率低下。DeepEP 用专门的 dispatch 和 combine 内核替代这些操作,利用 NVLink 处理节点内流量,并通过 libfabric 支持的 EFA 进行节点间传输,从而减少每条消息的开销,并通过 GPUDirect RDMA 绕过 CPU/OS 的参与。
大规模 RL rollout 中量化的吞吐量提升
在 48 台 P5en 实例上运行超级稀疏 MoE 模型的基准测试表明,启用基于 EFA 的 DeepEP 后,RL rollout 的总吞吐量提升了 40%。这凸显了网络传输优化对 RL 训练中推理密集型阶段的关键影响。
面向成本与稳定性的架构关注点分离
该架构区分了紧耦合的策略训练(需要稳定、同步的 GPU 容量)和弹性的 rollout 生成(分布式推理)。对 rollout worker 使用 EC2 Spot 实例可以降低成本,因为中断只影响独立任务,而策略训练则不受这种波动的影响。
异步 RL 循环中的异构资源平衡
大规模 RL 需要在计算密集型训练与内存带宽密集型推理之间取得平衡。该解决方案为 GPU 训练、GPU/CPU rollout 和内存优化缓冲区使用独立的 EKS 节点组,以防止任何单一资源约束(计算、内存或带宽)成为瓶颈。
💬 Key Quotes
随着更新的 MoE 架构变得越来越稀疏以降低推理成本,训练受到的约束更多来自通信而非计算。
在 48 台 P5en 实例上……启用基于 EFA 的 DeepEP 后,RL rollout 的总吞吐量提升了 40%。
与策略训练中紧耦合的 worker 必须同步推进不同,rollout worker 的中断不需要整个 RL 任务停止。
📊 Article Meta
AI Screening: 86
Source: AWS Artificial Intelligence
Author: Ashvin Nihalani
Category: 人工智能
Language: 英文
Read Time: 15 min
Word Count: 3706
Tags:
AI 与智能应用 , 模型训练与推理 , 强化学习 , 云原生 / DevOps , 性能优化
楼主辛苦了,内容很有参考价值。
这篇文章分析得很透彻,收藏了!
这个观点很中肯,深有同感。
楼主辛苦了,内容很有参考价值。
支持作者,持续关注中。
刚好最近在找这方面的资料,太及时了。
很有价值的分享,感谢整理。
点赞,必须点赞
路过
实话,说的不明不白
很有价值的分享,感谢整理。
写得挺用心的,支持一下。