返回
Knowledge distillation from relative distribution
DOI:10.1016/j.eswa.2025.127736.png)
摘要
En 中文
基于logits的知识蒸馏方法旨在从神经网络的输出logits中提取更有效的信息,通过softmax操作将教师模型全连接层生成的输出转换为概率分布,并将学生模型的概率分配与教师模型对齐。然而,softmax对负值的敏感性不足导致负值信息缺失,阻碍了知识的传递。为应对这一挑战,我们提出了一种基于相对分布的logit蒸馏方法。具体而言,我们首先从网络输出的logits构造负值反转logits(NVRL),以提取负logits中的信息,然后利用不同类别间的相对分布来补充NVRL中丢失的分布信息。与传统知识蒸馏方法相比,我们的方法在CIFAR-100和ImageNet数据集上实现了1.1%至3.98%的提升,并在迁移学习任务中实现了1.95%的提升。与基于特征的知识蒸馏方法相比,它不需要额外的特征匹配辅助模块,且易于适用于多样化的神经网络结构。
Keyword:
Deep learning
Knowledge distillation
Logit knowledge distillation
Relative distribution
Transfer learning
期刊
IF:
7.5
论文数:
3.0W
被引数:
10.2W
机构
引用论文
Reciprocal Teacher-Student Learning via Forward and Feedback Knowledge Distillation通过正向和反馈知识蒸馏实现师生互惠学习
ShuffleNet: An Extremely Efficient Convolutional Neural Network for Mobile DevicesShuffleNet: 一种用于移动设备的极其高效的卷积神经网络

