arrow
返回

Dynamic Communication Optimization with Collision Avoidance for Parallel Programs in Distributed Systems

delete2026-03-17
delete0
PRE
AI
W
Wang, Zhoukai *
S
Shin-ichiro Mori
DOI:10.1007/s10766-025-00808-0delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在具有冗余网络路径的分布式系统中,为并行程序动态选择最优通信路由对于最小化延迟和避免拥塞至关重要。然而,由于不可预测的网络条件和并发工作负载导致时变性能特征,这具有挑战性。本文提出了一种强化学习框架,使程序能够基于历史性能自适应选择通信路由,而无需全局网络状态监控。我们针对小候选集采用上置信界1(UCB1)算法,针对较大集采用改进的$\epsilon$-greedy算法,在静态环境中提供对数遗憾界,在动态场景中提供次线性遗憾。我们在3-Quads集群(一个具有三个冗余子网络的分布式系统,其中模拟和可视化程序并发运行)上展示了该方法。实验表明,与随机路由相比,我们的方法将数据传输延迟降低了30-45%,故障率低于6%,开销小于0.6%。该方法在500轮通信内针对不同数据量收敛至近最优路由。虽然在3-Quads上进行了实验验证,但理论分析表明该框架可推广至其他冗余网络拓扑(包括胖树和蜻蜓网络),其性能保证对网络拓扑的依赖仅限于候选集大小m。
Keyword:
Distributed systems
Reinforcement learning
Communication optimization
Multi-path routing
Online learning

期刊

I
International Journal of Parallel Programming
IF:
0.9
论文数:
18
被引数:
476

机构

X
Xi'an University of Technology
学者数:
3.6K
论文数: 1.1K
被引数: 1.1W
U
University of Fukui
学者数:
3.6K
论文数: 2.6K
被引数: 1.4K