返回
Execution-Delay-Balanced Pipeline-Parallelism-Based Distributed Model Training for Artificial Intelligence Data Centers Interconnected by Optical Networks
DOI:10.1109/jiot.2026.3704665.png)
摘要
En 中文
利用管道并行技术实现人工智能数据中心(AIDCs)的分布式模型训练是可行的,其中基于Transformer的分布式模型训练(TDMT)任务被划分为多个顺序阶段并卸载到合适的AIDCs。然而,由于划分点数量和位置的不可预测性,确定合适的划分和卸载决策以满足延迟要求具有挑战性。本文提出了一种基于执行延迟平衡的管道并行分布式模型训练(EP-DMT)方案,该方案联合调度计算和网络资源,以确定TDMT任务的划分和卸载决策。其目标是最小化气泡时间,从而提高训练效率。开发了一种启发式算法,通过基于资源状态估计基本阶段数量和执行延迟来确定每个阶段。同时优化了AIDCs的选择以及各阶段的路由和波长分配(RWA)方案。仿真结果表明,与基准方法相比,EP-DMT具有更高的接受率和更低的气泡时间。
Keyword:
Artificial intelligence data centers (AIDCs)
distributed model training (DMT)
optical networks
pipeline parallelism
task offloading
期刊
IF:
8.9
论文数:
1.4W
被引数:
7.8W
机构
引用论文
Distributed Model Training Based on Data Parallelism in Edge Computing-Enabled Elastic Optical Networks边缘计算弹性光网络中基于数据并行的分布式模型训练

