返回
Adaptive Temperature Distillation method for mining hard samples' knowledge
DOI:10.1016/j.neucom.2025.129745.png)
摘要
En 中文
知识蒸馏可以通过高温因子将知识从复杂的教师网络转移到简单的学生网络中,从而提升后者的性能。然而,现有研究通常使用固定温度,这使得它们在挖掘困难样本中丰富的知识方面效果不佳。具体而言,高温倾向于过度平滑困难样本中的知识,而低温则使知识在简单样本上几乎等同于硬标签。在本文中,我们提出了一种自适应温度蒸馏(ATD)方法,以有效解决这些挑战。我们利用训练良好的教师网络的信息熵来评估样本的相对难度。然后,在困难样本中使用低温,这使得学生网络能够更有效地学习其暗知识。而在简单样本中使用高温,以防止学生网络过度自信并忽略负类的暗知识。此外,我们提出了一种mixup变体,以使学生网络能够获取更多具有丰富暗知识的困难样本。与现有mixup研究关注数据增强不同,ATD侧重于通过混合简单样本和困难样本的输出logits来增加暗知识的丰富性。通过将其与最先进的知识蒸馏方法进行比较,ATD的整体性能在多个基准数据集上得到了验证。
Keyword:
Knowledge distillation
Knowledge mining
Mixup
Temperature
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W

