返回
Enhancing 3D Instance Segmentation With Dense Connection Decoder and Layer-Aware Fusion
DOI:10.1109/LRA.2025.3600142.png)
摘要
En 中文
3D实例分割(3DIS)旨在通过预测二值前景掩码及其对应的语义标签,来识别3D场景中的对象实例。基于Transformer的方法通过注意力机制有效捕获全局上下文信息,已展现出强大的性能。然而,现有方法主要关注场景特征与实例查询之间的外部关系,而忽略了跨解码器层查询之间的内部依赖。这一局限性可能导致层间查询掩码预测的不一致性,最终阻碍分割性能并延缓模型收敛。为解决此问题,我们提出了密集连接解码器(DCD),一种新型架构,明确建模了跨解码器层的实例查询之间的依赖关系。我们的设计引入了融合模块(Fusion Module)和记忆模块(Memory Module)来构建分层感知的混合状态,基于解码器距离动态分配先前查询的信息权重。此外,选择模块(Selection Module)通过门控机制优化查询特征,自适应地控制上游信息的影响。通过强制层间预测一致性,DCD不仅能提升分割精度,还能加速模型收敛。在ScanNetV2、ScanNet++V2、ScanNet200和S3DIS上的大量实验表明,DCD优于现有的基于Transformer的基准方法,实现了最先进(state-of-the-art)的性能和更快的收敛速度。
Keyword:
RGB-D perception
computer vision for automation
deep learning for visual perception
期刊
I
IF:
5.3
论文数:
1.7K
被引数:
3.9W

