arrow
返回

Priority-Driven Flow Scheduling for Distributed Large Language Model Training

delete2026-05-01
delete0
PRE
AI
T
Tianshi Wang
Y
Yiran Zhang *
Z
Zhang, Yiao
Z
Zhang, Qiyang
Z
Zhou, Ao
S
Shangguang Wang
DOI:10.23919/cje.2025.00.349delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大规模语言模型(LLM)训练高度依赖于分布式加速器之间的高效通信协调。现有方法主要关注独立优化特定的并行策略,但缺乏对不同通信模式的系统性优先级排序,导致训练性能次优。本文提出了一种混合并行优先级分配框架HyPA。HyPA采用离线代理建模进行闭式优先级优化,并结合在线参数感知实现动态环境适应,从而在不修改网络基础设施的情况下实现自适应带宽分配和拥塞控制。通过对真实训练工作负载的全面评估,HyPA在密集型和稀疏型LLM模型的任务完成时间上均实现了显著改进。在微基准测试中,任务完成时间最多缩短18.59%,在大型训练部署中最多缩短16%。
Keyword:
Modeling
Training
Parallel processing
Large language models
Fluid flow
Optimization
Schedules
Scheduling
Calculators
Servers
Distributed training
Flow scheduling
Pipeline parallelism
Data parallelism
Communication optimization

期刊

C
Chinese Journal of Electronics
IF:
3
论文数:
97
被引数:
1.7K

机构

B
beijing university of posts & telecommunications
学者数:
1.4W
论文数: 1.2W
被引数: 9
P
peking university
学者数:
11.9W
论文数: 8.7W
被引数: 146