返回
Priority-Driven Flow Scheduling for Distributed Large Language Model Training
DOI:10.23919/cje.2025.00.349.png)
摘要
En 中文
大规模语言模型(LLM)训练高度依赖于分布式加速器之间的高效通信协调。现有方法主要关注独立优化特定的并行策略,但缺乏对不同通信模式的系统性优先级排序,导致训练性能次优。本文提出了一种混合并行优先级分配框架HyPA。HyPA采用离线代理建模进行闭式优先级优化,并结合在线参数感知实现动态环境适应,从而在不修改网络基础设施的情况下实现自适应带宽分配和拥塞控制。通过对真实训练工作负载的全面评估,HyPA在密集型和稀疏型LLM模型的任务完成时间上均实现了显著改进。在微基准测试中,任务完成时间最多缩短18.59%,在大型训练部署中最多缩短16%。
Keyword:
Modeling
Training
Parallel processing
Large language models
Fluid flow
Optimization
Schedules
Scheduling
Calculators
Servers
Distributed training
Flow scheduling
Pipeline parallelism
Data parallelism
Communication optimization
期刊
C
IF:
3
论文数:
97
被引数:
1.7K

