返回
Efficient knowledge distillation via salient feature masking
DOI:10.1063/5.0312051.png)
摘要
En 中文
传统知识蒸馏(KD)将教师模型的所有输出传递给学生模型,通常会引入知识冗余。这种冗余会稀释关键信息,导致学生模型性能下降。为解决这一问题,我们提出了显著特征掩码知识蒸馏(SFKD),这是一种轻量级增强方法,通过屏蔽信息量较少的组件并选择性蒸馏仅前K个激活值。SFKD是一种可直接应用的修改,适用于基于logit和基于特征的知识蒸馏,开销极小,并能增强学生的学习信号。实验结果表明,SFKD在各种架构(ConvNeXt、ViT)和数据集(CIFAR-100:最高提升2.43个百分点;CUB-200:最高提升6.39个百分点;ImageNet-1K:最高提升3.57个百分点)上均优于强大的KD基线方法。我们还从信息瓶颈的角度提供了直觉解释,说明过滤掉教师模型中显著性较低的信号为何有益于学生模型。总体而言,SFKD是一种简单且经验验证有效的方法,用于训练更精简且更准确的学生模型。

