arrow
返回

DFormer++: Improving RGBD Representation Learning for Semantic Segmentation

delete2026-01-27
delete0
PRE
AI
B
Bo-Wen Yin
J
Jiao-Long Cao
D
Dan Xu
M
Ming‐Ming Cheng
Q
Qibin Hou
DOI:10.1109/TPAMI.2026.3658114delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
我们探索了预训练和微调方式在RGB-D语义分割中的应用潜力,以解决该领域常见的匹配问题。具体而言,我们提出了一种新颖的RGB-D预训练和微调框架DFormer++,用于学习可迁移的RGB-D语义分割表示。本文有两个重要创新:1)框架视角:与现有方法不同,现有方法将预训练的RGB骨干网络微调到RGB-D场景中,我们使用ImageNet-1 K中的图像-深度对预训练骨干网络,从而使模型具备编码RGB-D表示的能力;2)架构视角:我们的模型包含一系列RGB-D注意力块,这些块通过一种新颖的注意力机制定制用于编码RGB和深度信息。我们的DFormer++避免了预训练的RGB骨干网络对深度图中3D几何关系的错配编码,这在先前的工作中普遍存在但尚未解决。同时,定制的架构大大减少了编码RGB-D数据的冗余参数,并实现了高效准确的感知。实验结果表明,我们的DFormer++在三个流行的RGB-D语义分割基准上达到了新的最先进性能。
Keyword:
Attention mechanism
depth
pretraining-and-finetuning
RGB-D representation learning

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
1.0K
被引数:
9.8W

机构

H
hong kong university of science and technology
学者数:
925
论文数: 517
被引数: 1
N
nankai university
学者数:
4.8W
论文数: 3.3W
被引数: 74
引用论文

引用论文

暂无论文信息