在 Amazon EKS 上利用 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%
AWS 通过 Amazon EKS、EFA 和 DeepEP 优化 MoE 模型的大规模强化学习训练。该方法协调 rollout 推理与策略训练的异构资源,并在数百个加速器间维持高吞吐通信;相比原有方案,整体吞吐量提升 40%。
AWS 通过 Amazon EKS、EFA 和 DeepEP 优化 MoE 模型的大规模强化学习训练。该方法协调 rollout 推理与策略训练的异构资源,并在数百个加速器间维持高吞吐通信;相比原有方案,整体吞吐量提升 40%。