arrow
返回

Pixel-Perfect Visual Geometry Estimation

delete2026-08-25
delete0
PRE
AI
G
Gangwei Xu
H
Haotong Lin
H
Hongcheng Luo
H
Haiyang Sun
B
Bing Wang
G
Guang Chen
S
Sida Peng
H
Hangjun Ye
杨新艳 封面图
杨新艳 (Xin Yang)
DOI:10.1109/tpami.2026.3727248delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
从图像中恢复干净且准确的几何形状对于机器人和增强现实至关重要。然而,现有的几何基础模型仍然严重受到飞像素和细节丢失的影响。在本文中,我们提出了像素级完美的视觉几何模型,能够通过利用像素空间的生成建模来预测高质量、无飞像素的点云。我们首先介绍了像素级完美深度(PPD),一种基于像素空间扩散变换器(DiT)的单目深度基础模型。为解决像素空间扩散的高计算复杂度问题,我们提出了两项关键设计:1)语义引导的DiT,它整合来自视觉基础模型的语义表示来引导扩散过程,在保持全局语义的同时增强细粒度视觉细节;2)级联DiT架构,该架构逐步增加图像标记的数量,提高效率和准确性。为进一步将PPD扩展到视频(PPVD),我们引入了一种新的语义一致性DiT,它从多视图几何基础模型中提取时序一致的语义。然后,我们在DiT内执行基于参考的标记传播,以保持时序一致性,同时最小化计算和内存开销。我们的模型在所有生成式单目和视频深度估计模型中实现了最佳性能,并且产生的点云比其他所有模型都要干净得多。代码可在https://github.com/gangweix/pixel-perfect-depth获取。
Keyword:
Modeling
Pixel
Videos
Depth measurement
Semantics
Geometry
Visualization
Diffusion models
Measurement
Training

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
1.0K
被引数:
9.8W

机构

H
Huazhong University of Science and Technology
学者数:
3.9K
论文数: 1.0K
被引数: 0
X
xiaomi ev
学者数:
16
论文数: 6
被引数: 0
Z
zhejiang university
学者数:
5.6K
论文数: 1.6K
被引数: 0
学者 查看更多机构
引用论文

引用论文

暂无论文信息