返回
A min–max optimization framework for sparse multi-task deep neural network
DOI:10.1016/j.neucom.2025.130865.png)
摘要
En 中文
多任务学习是机器学习的一个子领域,其中使用共享模型训练数据以同时解决不同任务。与训练多个模型不同,我们只需要训练一个具有共享参数的单一模型来解决不同任务。通过共享参数,多任务学习显著减少了参数数量,并降低了计算和存储需求。然而,当将多任务学习应用于深度神经网络时,模型大小仍然是一个挑战,特别是对于边缘平台。在压缩多任务模型的同时保持所有任务上的性能是另一个重大挑战。为解决这些问题,我们提出了一种用于高度压缩的多任务深度神经网络模型的min–max优化框架,结合权重剪枝或动态稀疏训练策略,通过减少模型参数来提高训练效率。具体而言,权重剪枝利用重新加权l1剪枝方法,能够在高剪枝率下保持所有任务的性能。而动态稀疏训练则在训练过程中动态初始化和更新网络的稀疏掩码,同时保持相同的权重数量,这通常会促进权重矩阵的稀疏性,并具有减少内存占用和计算需求的优势。我们提出的min–max优化框架可以自动调整不同任务之间的可学习权重因子,确保对表现最差的任务进行优化。在NYUv2和CIFAR-100数据集上的实验结果表明,使用min–max框架剪枝后,模型的性能仅发生轻微退化。进一步分析表明,min–max框架具有可靠的性能,且与先前方法相比在统计上具有显著差异。所提出的动态稀疏多任务框架在使用min–max优化时,在模型稀疏程度相同时,相比先前方法实现了约2%的整体精度提升。
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
暂无机构信息
引用论文
CTF-former: A novel simplified multi-task learning strategy for simultaneous multivariate chaotic time series predictionCtf-former: 一种简化的多任务学习策略,用于同时进行多变量混沌时间序列预测
NEURAL NETWORKS
IF6.3
Multi-task learning for the prediction of wind power ramp events with deep neural networks
NEURAL NETWORKS
IF6.3

