返回
Collaborative and Progressive Teacher-Assistant Knowledge Distillation
DOI:10.1007/978-981-95-5693-9_30.png)
摘要
En 中文
知识蒸馏使紧凑型学生模型能够从更大的教师模型中学习,以更少的参数实现具有竞争力的精度。尽管其效率较高,但当教师与学生之间的架构存在差异时,有效转移知识仍面临挑战。为缓解这一问题,教师-助教知识蒸馏(TAKD)引入了一个中间助教模型来弥合差距。虽然后来的研究改进了助教架构和训练目标,但现有方法仍受制于次优的分类指导,因为学生是从一个近似原始教师分类能力的助教分类器中学习,并且缺乏一种能够适应学生不断变化的训练需求的渐进式学习方案。在本文中,我们提出了协作式渐进教师-助教知识蒸馏(CPTAKD),它通过联合对齐来自助教和原始教师的特征表示来指导学生学习。同时,我们直接重用了一个融合分类器,该分类器由集成两个教师的预训练分类器构建而成。此外,我们设计了一个指导计划,逐步将监督从助教转移到原始教师,从而实现从简单到复杂知识的平稳过渡。广泛的实验证明了我们提出方法的有效性,显示出优于相关蒸馏工作的性能。
Keyword:
Knowledge distillation
Teacher-Assistant learning
Progressive guidance
期刊
P
IF:
0
论文数:
27
被引数:
0
机构
引用论文
Inplace knowledge distillation with teacher assistant for improved training of flexible deep neural networks就地知识蒸馏结合教师助手,以改进灵活深度神经网络的训练

