返回
Pixel-Perfect Visual Geometry Estimation
DOI:10.1109/tpami.2026.3727248.png)
摘要
En 中文
从图像中恢复干净且准确的几何形状对于机器人和增强现实至关重要。然而,现有的几何基础模型仍然严重受到飞像素和细节丢失的影响。在本文中,我们提出了像素级完美的视觉几何模型,能够通过利用像素空间的生成建模来预测高质量、无飞像素的点云。我们首先介绍了像素级完美深度(PPD),一种基于像素空间扩散变换器(DiT)的单目深度基础模型。为解决像素空间扩散的高计算复杂度问题,我们提出了两项关键设计:1)语义引导的DiT,它整合来自视觉基础模型的语义表示来引导扩散过程,在保持全局语义的同时增强细粒度视觉细节;2)级联DiT架构,该架构逐步增加图像标记的数量,提高效率和准确性。为进一步将PPD扩展到视频(PPVD),我们引入了一种新的语义一致性DiT,它从多视图几何基础模型中提取时序一致的语义。然后,我们在DiT内执行基于参考的标记传播,以保持时序一致性,同时最小化计算和内存开销。我们的模型在所有生成式单目和视频深度估计模型中实现了最佳性能,并且产生的点云比其他所有模型都要干净得多。代码可在https://github.com/gangweix/pixel-perfect-depth获取。
Keyword:
Modeling
Pixel
Videos
Depth measurement
Semantics
Geometry
Visualization
Diffusion models
Measurement
Training
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W
机构
引用论文
暂无论文信息

