返回
Random Sparse Networks Training with Sharpness-Aware Regularization
DOI:10.1109/tpami.2026.3722118.png)
摘要
En 中文
过参数化对优化神经网络至关重要,而直接训练稀疏网络往往难以达到令人满意的性能。然而,彩票票假设(LTH)表明,一个随机初始化的密集模型存在一个稀疏子网络,可通过迭代幅度剪枝识别,同时保持较强的可训练性。本研究考察了LTH的一个互补视角,并提出双彩票票假设(DLTH),以实现稀疏网络的一般训练。具体而言,DLTH断言,任何从其密集对应网络中随机选取的子网络均可转化为具有良好可训练性的状态。为验证DLTH,我们引入了锐度感知随机稀疏网络变换(SA-RST),该技术利用正则化项从预定被掩蔽的权重中提取信息。此外,该提取过程根据优化过程中的模型锐度动态调整。在多个基准测试中使用CNN和Transformer架构进行的实验证明了我们的SA-RST的有效性,并验证了提出的DLTH。此外,我们与动态稀疏训练方法(RigL、SET)进行了全面比较,并对锐度感知组件进行了消融研究,以验证我们的设计选择。本研究有望为一般稀疏网络训练提供新的见解。
Keyword:
Sparse Network
Regularized Training
Sharpness-aware
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W
机构
引用论文
暂无论文信息

