返回
A Dual-Channel Collaborative Transformer for continual learning
DOI:10.1016/j.asoc.2025.112792.png)
摘要
En 中文
深度神经网络在许多静态任务中取得了成功,但在增量场景下常常遭受灾难性遗忘。近期趋势表明,动态结构方法(使用独立分支处理每个任务)能够有效缓解持续学习中的这一问题。然而,这些方法通常需要大量内存,且过度强调防止任务干扰,或仅允许在有限程度上共享任务知识(通常限于浅层中的任务通用知识)。此外,在使用蒸馏损失引导新任务学习时,其通常仅限于对齐新旧模型的最后一层输出。本文提出了一种基于编码器/解码器框架的新型双通道协作Transformer(DCCT)。该框架包含一个稳定通道和一个累积通道,稳定通道保留旧任务知识,累积通道学习新任务知识。此外,我们引入提示技术,设计了一种新颖的任务特定注意力块(TSAB),其为每个任务训练任务特定token,以小参数实现任务特定注意力。TSAB能够提取任务特定知识并促进它们之间的主动协作。进一步地,我们引入了多层空间注意力图蒸馏损失(MSAD),利用中间层中更通用的知识,增强模型对各类任务的适应性。我们在两个基准数据集CIFAR100和ImageNet100以及真实世界的食物图像分类数据集Food101上进行了大量实验。结果表明,所提出的DCCT模型取得了良好的效果。
Keyword:
Incremental learning
TAsk-Specific Attention
Prompt driven
Spatial Attention Map Distillation
期刊
IF:
6.6
论文数:
1.4W
被引数:
4.8W

