返回
KD2M: A Unifying Framework for Feature Knowledge Distillation
DOI:10.1007/978-3-032-03921-7_13.png)
摘要
En 中文
知识蒸馏(KD)旨在将教师模型的知识转移到学生神经网络中。这一过程通常通过匹配网络的预测(即输出)来完成,但近期有研究提出匹配神经网络激活分布(即特征)的方法,即分布匹配。在本文中,我们提出了一个统一的框架,即通过分布匹配的知识蒸馏(KDM),对这一策略进行形式化。我们的贡献有三方面:i) 提供了分布匹配中使用的分布度量的概述,ii) 在计算机视觉数据集上进行了基准测试,iii) 推导出知识蒸馏的新理论结果。
Keyword:
Knowledge Distillation
Optimal Transport
Computational Information Geometry
Deep Learning
期刊
G
IF:
0
论文数:
41
被引数:
0
机构
暂无机构信息

