arrow
返回

Parallel Momentum Methods Under Biased Gradient Estimations

delete2025-06-01
delete0
delete
OA
AI
A
Ali Beikmohammadi
S
Sarit Khirirat
S
Sindri Magnússon
DOI:10.1109/TCNS.2025.3527255delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
并行随机梯度方法在解决涉及跨多节点分布数据的机器学习问题上正日益受到关注。然而,在许多分布式机器学习应用中,获得无偏随机梯度(这是大多数理论研究的重点)具有挑战性。梯度估计很容易产生偏差,例如在梯度压缩或裁剪、数据打乱以及在元学习和强化学习中。在本工作中,我们针对一般非凸和μ-波亚克-Łojasiewicz问题,在梯度估计有偏的情况下,建立了并行动量方法的渐进界。我们的分析涵盖了通用的分布式优化问题,并研究了梯度估计有偏的特例,即元学习、梯度压缩或裁剪的情况。我们的数值实验验证了我们的理论发现,并表明动量方法比传统的有偏梯度下降具有更快的收敛性能。
Keyword:
Biased gradient estimation
composite gradients
compressed gradients
parallel momentum methods
stochastic gradient descent (SGD)

期刊

IEEE Transactions on Control of Network Systems 封面图
IEEE Transactions on Control of Network Systems
IF:
5
论文数:
1.7K
被引数:
5.8K

机构

S
Stockholm University
学者数:
1.8W
论文数: 1.7W
被引数: 32
引用论文

引用论文

Robust Regression and Lasso
err2010-07-01
err0
errOAAI
errHuan Xu; Constantine Caramanis; Shie Mannor
err分享
err收藏
Why random reshuffling beats stochastic gradient descent
err2019-10-29
err0
errOAAI
errM. Gürbüzbalaban; A. Ozdaglar; P. A. Parrilo
err分享
err收藏
Stochastic analog of the conjugant-gradient method
err1974-01-01
err0
PREAI
errGupal,A. M.; Bazhenov,L. G.
err分享
err收藏
Robust Aggregation for Federated Learning
err2022-01-01
err0
errOAAI
errKrishna Pillutla; Sham M. Kakade; Zaid Harchaoui
err分享
err收藏
err分享
err收藏
学者 查看更多内容