arrow
返回

Efficient knowledge distillation via salient feature masking

delete2026-03-01
delete0
PRE
AI
A
Assel Kembay
S
Skye Gunasekaran
R
Rui-jie Zhu
Y
Yu Zhang
E
Eshraghian, Jason K. *
DOI:10.1063/5.0312051delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
传统知识蒸馏(KD)将教师模型的所有输出传递给学生模型,通常会引入知识冗余。这种冗余会稀释关键信息,导致学生模型性能下降。为解决这一问题,我们提出了显著特征掩码知识蒸馏(SFKD),这是一种轻量级增强方法,通过屏蔽信息量较少的组件并选择性蒸馏仅前K个激活值。SFKD是一种可直接应用的修改,适用于基于logit和基于特征的知识蒸馏,开销极小,并能增强学生的学习信号。实验结果表明,SFKD在各种架构(ConvNeXt、ViT)和数据集(CIFAR-100:最高提升2.43个百分点;CUB-200:最高提升6.39个百分点;ImageNet-1K:最高提升3.57个百分点)上均优于强大的KD基线方法。我们还从信息瓶颈的角度提供了直觉解释,说明过滤掉教师模型中显著性较低的信号为何有益于学生模型。总体而言,SFKD是一种简单且经验验证有效的方法,用于训练更精简且更准确的学生模型。

期刊

A
APL Machine Learning
IF:
0
论文数:
26
被引数:
0

机构

University of California System 封面图
University of California System
学者数:
37.7W
论文数: 33.8W
被引数: 6.6K
引用论文

引用论文

暂无论文信息