arrow
返回

Data-efficient multi-scale fusion vision transformer

delete2025-05-01
delete1
PRE
AI
H
Hao Tang
D
Dawei Liu
DOI:10.1016/j.patcog.2024.111305delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
Vision transformers (ViTs) 在大型数据集上的图像分类任务中表现出色,但在小型数据集上表现不佳。基础型 ViTs 是单尺度的,通过单一补丁大小将图像分割成补丁。在本文中,我们引入了多尺度标记,通过将图像分割成不同大小的补丁来实现多尺度。我们的模型将多个尺度的标记序列拼接起来进行注意力计算,并通过一个区域跨尺度交互模块融合这些标记,通过学习跨尺度的局部结构来提高数据效率。此外,我们实现了一个数据增强计划来优化训练。在图像分类任务上的大量实验表明,我们的方法在 CIFAR100 上超越了 DeiT 6.6%,在 ImageNet1K 上超越了 1.6%。代码可在 https://github.com/visresearch/dems 获得。
Keyword:
Deep learning
Image classification
Vision transformer
Data efficiency
Multi-scale fusion

期刊

Pattern Recognition 封面图
Pattern Recognition
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

暂无机构信息
引用论文

引用论文

err分享
err收藏
err分享
err收藏
err分享
err收藏
Tokens-to-Token ViT: Training Vision Transformers from Scratch on ImageNet
err2021-10-01
err0
errOAAI
errLi Yuan; Yunpeng Chen; Tao Wang; Weihao Yu; Yujun Shi; Zihang Jiang; Francis E. H. Tay; Jiashi Feng; Shuicheng Yan
err分享
err收藏
Asymmetric patch sampling for contrastive learning用于对比学习的非对称补丁采样
err2025-02-01
err0
errOAAI
errShen, Chengchao; Chen, Jianzhong; Wang, Shu; Kuang, Hulin; Liu, Jin; Wang, Jianxin
err分享
err收藏
err分享
err收藏
学者 查看更多内容