返回
On Segment-Aware Monocular Depth Estimation Using Vision Transformers
DOI:10.3390/info17020145.png)
摘要
En 中文
单目深度估计(MDE)从单张RGB图像推断逐像素的场景几何。尽管取得了近期进展,全局MDE模型通常会在物体边界模糊深度不连续性,并无法捕捉物体级结构。基于分割的深度估计通过利用语义分割将深度预测分解为更简单的、类别特定的子问题来解决这一限制。在本文中,我们研究了基于语义感知的MDE在多分支设计中的实现,其中每个语义类别由一个轻量级Vision Transformer(ViT)分支处理,该分支为其类别预测密集深度,同时抑制其他区域的干扰。我们进一步考察了融合策略,将分支输出合并为单一预测:(i) 一种可学习的交叉注意力融合模块,从堆叠的逐类提议和掩码中预测深度;(ii) 一种无参数的拼接求和,对掩码门控输出求和。所提出的架构简单、可扩展、端到端可训练,并兼容任意Transformer骨干网络。在Virtual KITTI 2上的实验(其中提供地面真实深度和语义标签)表明,基于分割的建模产生更清晰的深度边界,并相较于单分支基线改进了标准误差指标(AbsRel 0.243→0.152;RMSE 11.952→9.101)。最后,我们发现无参数求和与学习融合的精度相当,并在大多数情况下更优,且不增加计算开销。
Keyword:
monocular depth estimation
semantic segmentation
vision transformers
segment-aware learning
depth fusion
Virtual KITTI 2
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

