返回
Prototype-guided cross-task knowledge distillation
DOI:10.1631/FITEE.2400383.png)
摘要
En 中文
近年来,大规模预训练模型已在各种任务中展现出其优势。然而,由于巨大的计算复杂度和存储需求,将大规模模型应用于实际场景具有挑战性。现有的知识蒸馏方法主要要求教师模型和学生模型共享相同的标签空间,这限制了它们在实际场景中的应用。为缓解不同标签空间的约束,我们提出了一种原型引导的跨任务知识蒸馏(ProC-KD)方法,用于将教师网络内在的局部级对象知识迁移到各种任务场景中。首先,为更好地学习跨任务场景中的泛化知识,我们提出一个原型学习模块,用于学习教师网络中不变的内在局部对象表示。其次,针对多样化的下游任务,我们提出了一个任务自适应特征增强模块,用以通过学习到的泛化原型表示增强学生网络的特征,并指导学生网络的学习以提升其泛化能力。在多种视觉任务上的实验结果表明,我们的方法在跨任务知识蒸馏场景中是有效的。
期刊
IF:
2.9
论文数:
129
被引数:
2.5K

