arrow
返回

Random Sparse Networks Training with Sharpness-Aware Regularization

delete2026-08-10
delete0
PRE
AI
Y
Yue Bai
M
Mingyuan Zhang
H
Huan Wang
陶
陶志强 (Zhiqiang Tao)
李
李鲲鹏 (Kunpeng Li)
王亦洲 封面图
王亦洲 (Yizhou Wang)
Y
Yun Fu
DOI:10.1109/tpami.2026.3722118delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
过参数化对优化神经网络至关重要,而直接训练稀疏网络往往难以达到令人满意的性能。然而,彩票票假设(LTH)表明,一个随机初始化的密集模型存在一个稀疏子网络,可通过迭代幅度剪枝识别,同时保持较强的可训练性。本研究考察了LTH的一个互补视角,并提出双彩票票假设(DLTH),以实现稀疏网络的一般训练。具体而言,DLTH断言,任何从其密集对应网络中随机选取的子网络均可转化为具有良好可训练性的状态。为验证DLTH,我们引入了锐度感知随机稀疏网络变换(SA-RST),该技术利用正则化项从预定被掩蔽的权重中提取信息。此外,该提取过程根据优化过程中的模型锐度动态调整。在多个基准测试中使用CNN和Transformer架构进行的实验证明了我们的SA-RST的有效性,并验证了提出的DLTH。此外,我们与动态稀疏训练方法(RigL、SET)进行了全面比较,并对锐度感知组件进行了消融研究,以验证我们的设计选择。本研究有望为一般稀疏网络训练提供新的见解。
Keyword:
Sparse Network
Regularized Training
Sharpness-aware

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
1.0K
被引数:
9.8W

机构

N
Northeastern University
学者数:
1.0K
论文数: 361
被引数: 0
R
Rochester Institute of Technology
学者数:
38
论文数: 25
被引数: 0
M
meta generative ai
学者数:
2
论文数: 1
被引数: 0
学者 查看更多机构
引用论文

引用论文

暂无论文信息