返回
Parallel segmentation network for real-time semantic segmentation
DOI:10.1016/j.engappai.2025.110487.png)
摘要
En 中文
实时语义分割在自动驾驶和机器人导航领域具有广泛的应用前景。最近,实时语义分割网络主要采用编码器-解码器架构和多头架构。然而,这两种方法各有优缺点。编码器-解码器模型通常在提取上下文信息方面表现更好,但在捕捉精细细节和局部空间信息方面可能面临挑战。而多头结构擅长捕捉边界和空间细节信息,但需要高效灵活的特征融合策略以避免信息冗余。为结合两种方法的优点,我们提出了并行分割网络(PaSeNet),采用非对称编码器-解码器结构,为实时语义分割的研究与应用引入新思路。具体而言,我们在编码阶段设计了一个带有空间信息增强路径的主分支,并引入基于自监督学习的掩码自编码器作为辅助分支,以补充主分支在提取细节和局部空间信息方面的能力。此外,我们提出了分组聚合金字塔池化模块(Grouped Aggregation Pyramid Pooling Module)以优化上下文信息的提取。在解码阶段,我们引入坐标注意力引导解码器(Coordinate-Attention-Guided Decoder),以有效整合不同分支的多样化信息。在Cityscapes、Cambridge-driving Labeled Video database(CamVid)、NightCity和实例分割空中图像数据集(instance Segmentation in Aerial Images Dataset)的大量实验表明,我们的方法取得了具有竞争力的结果。具体而言,PaSeNet-Base在Cityscapes测试集上以55.6帧每秒(FPS)达到79.9%的平均交并比(mIOU),在CamVid测试集上以96.8 FPS达到80.2%的mIOU。
Keyword:
Semantic segmentation
Real-time processing
Parallel segmentation network
Masked autoencoder
期刊
IF:
8
论文数:
5.7K
被引数:
3.5W
机构
暂无机构信息
引用论文
BiSeNet V3: Bilateral segmentation network with coordinate attention for real-time semantic segmentation
NEUROCOMPUTING
IF6.5
DeepLab: Semantic Image Segmentation with Deep Convolutional Nets, Atrous Convolution, and Fully Connected CRFsDeepLab: 使用深度卷积网络、Atrous卷积和全连接crf进行语义图像分割
SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image SegmentationSegNet: 一种用于图像分割的深度卷积编码器-解码器架构

