arrow
Return

Data-efficient multi-scale fusion vision transformer

delete2025-05-01
delete1
PRE
AI
H
Hao Tang
D
Dawei Liu
DOI:10.1016/j.patcog.2024.111305delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
Vision transformers (ViTs) excel in image classification with large datasets but struggle with smaller ones. Vanilla ViTs are single-scale, tokenizing images into patches with a single patch size. In this paper, we introduce multi-scale tokens, where multiple scales are achieved by splitting images into patches of varying sizes. Our model concatenates token sequences of multiple scales for attention, and a regional cross-scale interaction module fuses these tokens, improving data efficiency by learning local structures across scales. Additionally, we implement a data augmentation schedule to refine training. Extensive experiments on image classification demonstrate our approach surpasses DeiT by 6.6% on CIFAR100 and 1.6% on ImageNet1K. Code is available at https://github.com/visresearch/dems.
Keywords:
Deep learning
Image classification
Vision transformer
Data efficiency
Multi-scale fusion

Journal

Pattern Recognition cover
Pattern Recognition
IF:
7.6
Papers:
1.3W
Citations:
4.5W

Organization

No organization information available
Cited Papers

Cited Papers

ImageNet: A large-scale hierarchical image database
err2009-06-01
err0
PREAI
errJia Deng; Wei Dong; Richard Socher; Li-Jia Li; Kai Li; Li Fei-Fei
errShare
errSave
errShare
errSave
errShare
errSave
Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet
err2021-10-01
err0
errOAAI
errLi Yuan; Yunpeng Chen; Tao Wang; Weihao Yu; Yujun Shi; Zihang Jiang; Francis E. H. Tay; Jiashi Feng; Shuicheng Yan
errShare
errSave
Asymmetric patch sampling for contrastive learning
err2025-02-01
err0
errOAAI
errShen, Chengchao; Chen, Jianzhong; Wang, Shu; Kuang, Hulin; Liu, Jin; Wang, Jianxin
errShare
errSave
CutMix: Regularization Strategy to Train Strong Classifiers With Localizable Features
err2019-10-01
err0
errOAAI
errSangdoo Yun; Dongyoon Han; Sanghyuk Chun; Seong Joon Oh; Youngjoon Yoo; Junsuk Choe
errShare
errSave
errShare
errSave
researcher View more