返回
Data-efficient multi-scale fusion vision transformer
DOI:10.1016/j.patcog.2024.111305.png)
摘要
En 中文
Vision transformers (ViTs) 在大型数据集上的图像分类任务中表现出色,但在小型数据集上表现不佳。基础型 ViTs 是单尺度的,通过单一补丁大小将图像分割成补丁。在本文中,我们引入了多尺度标记,通过将图像分割成不同大小的补丁来实现多尺度。我们的模型将多个尺度的标记序列拼接起来进行注意力计算,并通过一个区域跨尺度交互模块融合这些标记,通过学习跨尺度的局部结构来提高数据效率。此外,我们实现了一个数据增强计划来优化训练。在图像分类任务上的大量实验表明,我们的方法在 CIFAR100 上超越了 DeiT 6.6%,在 ImageNet1K 上超越了 1.6%。代码可在 https://github.com/visresearch/dems 获得。
Keyword:
Deep learning
Image classification
Vision transformer
Data efficiency
Multi-scale fusion
期刊
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
暂无机构信息
引用论文
Multi-Criteria Token Fusion with One-Step-Ahead Attention for Efficient Vision Transformers多准则标记融合与单步前瞻注意力机制的高效视觉Transformer
CutMix: Regularization Strategy to Train Strong Classifiers With Localizable FeaturesCutMix: 训练具有可本地化特征的强分类器的正则化策略

