返回
Efficient Mixture-of-Experts Training With Pipelining Optimization
DOI:10.1109/tc.2026.3702749.png)
摘要
En 中文
稀疏激活的专家混合模型(MoE)已作为关键技术出现,用于扩展基于Transformer的大型语言模型(LLMs)的规模,同时保持低计算成本。然而,MoE层需要将输入数据路由到分布式设备,从而产生显著的通信延迟。现有研究主要通过在单个MoE层内重叠计算和通信任务来缓解这一问题,但这未能实现充分重叠,导致性能提升有限。在本文中,我们借鉴因果Transformer-based LLM的自回归特性,引入一个与现有任务并行方法正交的划分维度,即沿序列维度划分任务。这为非MoE层和MoE层的任务提供了更灵活高效的重叠方式。为此,我们提出了高效的MoE训练方法SP-MoE,包含两项创新设计:1)将非MoE层与当前MoE层及前一个MoE层进行重叠,从而促进更高效的训练;2)识别非MoE层和MoE层的最佳流水线度组合,并为负载不均衡的非MoE层和均匀MoE层设计最佳调度计划,以最小化总训练延迟。此外,我们将算法扩展以纳入流水线并行(PP)来训练更大的MoE模型,这引入了相邻PP阶段之间的点对点(P2P)通信。为缓解此问题,我们提出S3P-MoE,包含两项优化:1)将P2P通信划分为块,每个P2P块立即传输以与专家计算重叠;2)允许后续PP阶段在接收到对应P2P块后开始。此外,我们优化算法以联合优化MoE和非MoE层的流水线度以及P2P通信,以最小化整体训练延迟。大量实验表明,SP-MoE和S3P-MoE有效识别最佳流水线度,与当前最佳方法相比,分别将训练时间减少了34.3%和30.61%。
Keyword:
Mixture-of-experts
communication-efficient Training
pipelining
pipeline parallelism
期刊
IF:
3.8
论文数:
5.3K
被引数:
9.8K
机构
引用论文
暂无论文信息

