返回
Rejuvenating efficient convolutional neural networks
DOI:10.1007/s11554-025-01696-w.png)
摘要
En 中文
近年来,高效的卷积神经网络(CNN)模型由于与其他流行的高效模型相比性能相对较差,受到的关注有限。在本文中,我们提出了一种新型的基于CNN的高效模型,命名为MoConv,该模型保留了CNN的许多优势。我们的方法始于对Transformer编码器结构的分析,进而提出了综合卷积注意力(CCA)机制。通过将CCA与倒置残差块(IRB)结合使用,我们设计了类似于Transformer编码器的基本MoConv模块,并构建了适用于各类计算机视觉任务的MoConv模型。MoConv的有效性通过ImageNet、MS COCO和ADE20K等基准测试得到验证。例如,在ImageNet上使用1至2张RTX4090 GPU训练的MoConv-S/T/N模型,在ImageNet-1k上分别实现了78.6%、75.7%和72.2%的top-1准确率,计算开销仅为5.6M/1.4GFLOPs、2.3M/0.5GFLOPs和1.2M/0.3GFLOPs。这显著超越了同类别中最出色的SwiftFormer、ConvMLP、EMO、MobileViG和EfficientFormer等模型的性能。因此,我们的模型在主流轻量级模型中脱颖而出,成为优秀的选择。
Keyword:
Convolutional neural networks
Efficient
attention mechanism
Transformer encoder
Inverted residual block
期刊
IF:
3
论文数:
401
被引数:
2.0K
机构
引用论文
InternImage: Exploring Large-Scale Vision Foundation Models with Deformable ConvolutionsInternImage: 使用可变形卷积探索大型视觉基础模型
ShuffleNet V2: Practical Guidelines for Efficient CNN Architecture DesignShuffleNet V2: 高效CNN架构设计的实用指南

