arrow
返回

Efficient Mixture-of-Experts Training With Pipelining Optimization

delete2026-06-11
delete0
PRE
AI
N
Ne Wang
W
Wenxiang Lin
L
Lin Zhang
S
Shaohuai Shi
周睿婷 封面图
周睿婷 (Ruiting Zhou)
B
Bo Li
DOI:10.1109/tc.2026.3702749delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
稀疏激活的专家混合模型(MoE)已作为关键技术出现,用于扩展基于Transformer的大型语言模型(LLMs)的规模,同时保持低计算成本。然而,MoE层需要将输入数据路由到分布式设备,从而产生显著的通信延迟。现有研究主要通过在单个MoE层内重叠计算和通信任务来缓解这一问题,但这未能实现充分重叠,导致性能提升有限。在本文中,我们借鉴因果Transformer-based LLM的自回归特性,引入一个与现有任务并行方法正交的划分维度,即沿序列维度划分任务。这为非MoE层和MoE层的任务提供了更灵活高效的重叠方式。为此,我们提出了高效的MoE训练方法SP-MoE,包含两项创新设计:1)将非MoE层与当前MoE层及前一个MoE层进行重叠,从而促进更高效的训练;2)识别非MoE层和MoE层的最佳流水线度组合,并为负载不均衡的非MoE层和均匀MoE层设计最佳调度计划,以最小化总训练延迟。此外,我们将算法扩展以纳入流水线并行(PP)来训练更大的MoE模型,这引入了相邻PP阶段之间的点对点(P2P)通信。为缓解此问题,我们提出S3P-MoE,包含两项优化:1)将P2P通信划分为块,每个P2P块立即传输以与专家计算重叠;2)允许后续PP阶段在接收到对应P2P块后开始。此外,我们优化算法以联合优化MoE和非MoE层的流水线度以及P2P通信,以最小化整体训练延迟。大量实验表明,SP-MoE和S3P-MoE有效识别最佳流水线度,与当前最佳方法相比,分别将训练时间减少了34.3%和30.61%。
Keyword:
Mixture-of-experts
communication-efficient Training
pipelining
pipeline parallelism

期刊

IEEE Transactions on Computers 封面图
IEEE Transactions on Computers
IF:
3.8
论文数:
5.3K
被引数:
9.8K

机构

H
hong kong university of science and technology
学者数:
925
论文数: 517
被引数: 1
S
Southeast University
学者数:
2.1W
论文数: 8.6K
被引数: 480
H
Harbin Institute of Technology
学者数:
1.6W
论文数: 5.0K
被引数: 8.5W
W
wuhan university
学者数:
8.1W
论文数: 5.8W
被引数: 70
学者 查看更多机构
引用论文

引用论文

暂无论文信息