返回
Parallel Momentum Methods Under Biased Gradient Estimations
DOI:10.1109/TCNS.2025.3527255.png)
摘要
En 中文
并行随机梯度方法在解决涉及跨多节点分布数据的机器学习问题上正日益受到关注。然而,在许多分布式机器学习应用中,获得无偏随机梯度(这是大多数理论研究的重点)具有挑战性。梯度估计很容易产生偏差,例如在梯度压缩或裁剪、数据打乱以及在元学习和强化学习中。在本工作中,我们针对一般非凸和μ-波亚克-Łojasiewicz问题,在梯度估计有偏的情况下,建立了并行动量方法的渐进界。我们的分析涵盖了通用的分布式优化问题,并研究了梯度估计有偏的特例,即元学习、梯度压缩或裁剪的情况。我们的数值实验验证了我们的理论发现,并表明动量方法比传统的有偏梯度下降具有更快的收敛性能。
Keyword:
Biased gradient estimation
composite gradients
compressed gradients
parallel momentum methods
stochastic gradient descent (SGD)
期刊
IF:
5
论文数:
1.7K
被引数:
5.8K
机构
引用论文
RSA: Byzantine-Robust Stochastic Aggregation Methods for Distributed Learning from Heterogeneous DatasetsRSA: 用于从异构数据集进行分布式学习的拜占庭鲁棒随机聚合方法

