返回
Learning from Stochastic Teacher Representations Using Student-Guided Knowledge Distillation
DOI:10.1007/978-3-032-06106-5_14.png)
摘要
En 中文
自我蒸馏的进展表明,当使用相同的深度学习(DL)模型将知识从教师蒸馏到学生时,学生性能可以超越教师,尤其是在模型过参数化且教师使用早停训练的情况下。另一方面,集成学习也能提高性能,但随着模型数量的增加,训练、存储和部署多个DL模型变得不切实际。即使将深度集成蒸馏到单个学生模型或使用权重平均方法,首先也需要训练多个教师模型,并且未能充分利用DL模型内在的随机性来生成和蒸馏多样性。这些限制在资源受限或延迟敏感的应用(例如可穿戴设备)中尤为阻碍。本文提出仅训练一个模型,并使用蒸馏时dropout生成多个多样的教师表示。然而,这些表示的随机生成会导致与学习任务不一致的噪声表示。为克服此问题,引入了一种新颖的随机自我蒸馏(SSD)训练策略,用于过滤和加权教师表示,仅从与任务相关的表示中蒸馏,并使用学生引导的知识蒸馏。每个蒸馏步骤的学生表示用于指导蒸馏过程。在真实世界的情感计算、可穿戴/生物信号(UCR档案)、HAR和图像分类数据集上的实验结果(代码和补充材料可访问:https://github.com/haseebaslam95/SSD)表明,所提出的SSD方法可以在不增加模型大小的情况下,在训练和测试时超越最先进的方法。其计算复杂度与集成学习和权重平均方法相比可忽略不计。
Keyword:
Deep Learning
Self Distillation
Dropout
Time-Series
Student-Guided Knowledge Distillation
期刊
机构
引用论文
Exploration of physiological sensors, features, and machine learning models for pain intensity estimation
PLOS ONE
IF0
Personalized and adaptive neural networks for pain detection from multi-modal physiological features基于多模式生理特征的个性化和自适应神经网络用于疼痛检测

