arrow
返回

On Segment-Aware Monocular Depth Estimation Using Vision Transformers

delete2026-02-02
delete0
delete
OA
AI
V
Vasileios Arampatzakis *
G
George Pavlidis
N
Nikolaos Mitianoudis
N
Nikos Papamarkos
DOI:10.3390/info17020145delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
单目深度估计(MDE)从单张RGB图像推断逐像素的场景几何。尽管取得了近期进展,全局MDE模型通常会在物体边界模糊深度不连续性,并无法捕捉物体级结构。基于分割的深度估计通过利用语义分割将深度预测分解为更简单的、类别特定的子问题来解决这一限制。在本文中,我们研究了基于语义感知的MDE在多分支设计中的实现,其中每个语义类别由一个轻量级Vision Transformer(ViT)分支处理,该分支为其类别预测密集深度,同时抑制其他区域的干扰。我们进一步考察了融合策略,将分支输出合并为单一预测:(i) 一种可学习的交叉注意力融合模块,从堆叠的逐类提议和掩码中预测深度;(ii) 一种无参数的拼接求和,对掩码门控输出求和。所提出的架构简单、可扩展、端到端可训练,并兼容任意Transformer骨干网络。在Virtual KITTI 2上的实验(其中提供地面真实深度和语义标签)表明,基于分割的建模产生更清晰的深度边界,并相较于单分支基线改进了标准误差指标(AbsRel 0.243→0.152;RMSE 11.952→9.101)。最后,我们发现无参数求和与学习融合的精度相当,并在大多数情况下更优,且不增加计算开销。
Keyword:
monocular depth estimation
semantic segmentation
vision transformers
segment-aware learning
depth fusion
Virtual KITTI 2
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

I
Information
IF:
2.9
论文数:
833
被引数:
9.8K

机构

D
democritus university of thrace
学者数:
1.3K
论文数: 533
被引数: 0