arrow
返回

Maximizing the Computation-Communication Overlap for Distributed Deep Learning With Approximate AllReduce

delete2026-03-27
delete0
PRE
AI
S
Shouxi Luo *
G
Gaolin Tang
X
Xue Liu
H
Huanlai Xing
DOI:10.1016/j.future.2026.108498delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
众所周知,数据并行分布式深度学习(DDL)需要具备计算-通信重叠(CCO)意识的通信优化。AQGB(Adaptive Quantized Gradient Broadcast)的近期工作不仅提出了ROW(重叠时间与等待时间之比)这一指标来量化优化机会,还为此设计了一种CCO感知的自适应量化梯度同步方案。尽管效率较高,但AQGB仅针对训练工作节点通过直接广播同步梯度的情况进行了优化,因此无法支持依赖基于环全归约(Ring-AllReduce)和减半加倍(Halving Doubling-HD)全归约的梯度同步的DDL工作负载。
Keyword:
Computation-Communication Overlap
Distributed Deep Learning
Gradient Synchronization
Approximate AllReduce
Adaptive Quantization

期刊

F
Future Generation Computer Systems
IF:
0
论文数:
642
被引数:
0

机构

S
southwest jiaotong university
学者数:
9.6K
论文数: 3.3K
被引数: 0
引用论文

引用论文

err分享
err收藏
A Machine Learning Approach for Blockchain-Based Smart Home Networks Security
err2021-05-01
err64
errOAAI
errKhan, Muhammad Adnan; Abbas, Sagheer; Rehman, Abdur; Saeed, Yousaf; Zeb, Asim; Uddin, M. Irfan; Nasser, Nidal; Ali, Asmaa
err分享
err收藏
RDMA Transports in Datacenter Networks: Survey数据中心网络中的RDMA传输: 调查
err2024-11-01
err3
PREAI
errHu, Jinbin; Shen, Houqiang; Liu, Xuchong; Wang, Jin
err分享
err收藏
err分享
err收藏
A Survey on Distributed Machine Learning分布式机器学习综述
err2020-03-20
err430
errOAAI
errVerbraeken, Joost; Wolting, Matthijs; Katzy, Jonathan; Kloppenburg, Jeroen; Verbelen, Tim; Rellermeyer, Jan S.
err分享
err收藏
Efficient Cross-Cloud Partial Reduce With CREW
err2024-11-01
err0
PREAI
errLuo, Shouxi; Wang, Renyi; Li, Ke; Xing, Huanlai
err分享
err收藏
学者 查看更多内容