返回
DFormer++: Improving RGBD Representation Learning for Semantic Segmentation
DOI:10.1109/TPAMI.2026.3658114.png)
摘要
En 中文
我们探索了预训练和微调方式在RGB-D语义分割中的应用潜力,以解决该领域常见的匹配问题。具体而言,我们提出了一种新颖的RGB-D预训练和微调框架DFormer++,用于学习可迁移的RGB-D语义分割表示。本文有两个重要创新:1)框架视角:与现有方法不同,现有方法将预训练的RGB骨干网络微调到RGB-D场景中,我们使用ImageNet-1 K中的图像-深度对预训练骨干网络,从而使模型具备编码RGB-D表示的能力;2)架构视角:我们的模型包含一系列RGB-D注意力块,这些块通过一种新颖的注意力机制定制用于编码RGB和深度信息。我们的DFormer++避免了预训练的RGB骨干网络对深度图中3D几何关系的错配编码,这在先前的工作中普遍存在但尚未解决。同时,定制的架构大大减少了编码RGB-D数据的冗余参数,并实现了高效准确的感知。实验结果表明,我们的DFormer++在三个流行的RGB-D语义分割基准上达到了新的最先进性能。
Keyword:
Attention mechanism
depth
pretraining-and-finetuning
RGB-D representation learning
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W
机构
引用论文
暂无论文信息

