返回
Latent Object Embedding for Self-Supervised Monocular Depth Estimation
DOI:10.1109/TETCI.2025.3547851.png)
摘要
En 中文
从2D图像中提取3D信息具有重要意义,而自监督单目深度估计在该领域已展现出巨大潜力。然而,现有方法主要侧重于从即时视觉特征估计深度,导致前景与背景严重粘连,这对实现精确深度估计构成挑战。本文提出了一种名为LOEDepth的深度估计方法,能够隐式区分前景物体与背景。在LOEDepth中,引入了一个潜在物体嵌入模块,该模块利用一组可学习查询,从编码器提取的即时视觉特征以及通过多尺度可变形注意力导出的稀疏物体特征中生成潜在物体提议。这些潜在物体提议被用于对解码特征进行软分类,以区分前景物体与背景。此外,由于深度边界并不总是与语义边界一致,本文提出了一种新型深度解码器,用以提供具有丰富空间位置检索和语义信息的解码特征。最后,采用两种掩码策略来隐藏违反场景静态假设的像素,以缓解自监督训练过程中异常像素造成的干扰。在KITTI和Make3D数据集上的实验结果表明,所提方法在性能上显著提升,并具备鲁棒的细粒度场景深度估计能力。
Keyword:
Monocular depth estimation
self-supervised learning
structure from motion
latent object embedding
期刊
I
IF:
6.5
论文数:
1.4K
被引数:
4.5K
机构
引用论文
暂无论文信息

