返回
IGEV++: Iterative Multi-Range Geometry Encoding Volumes for Stereo Matching
DOI:10.1109/TPAMI.2025.3569218.png)
摘要
En 中文
立体匹配是许多计算机视觉和机器人系统中的核心组件。尽管过去十年取得了显著进展,但在处理不适定区域和大幅差中的匹配模糊性方面仍是一个开放性挑战。在本文中,我们提出了一种新的深度网络架构,称为IGEV++,用于立体匹配。所提出的IGEV++构建了多范围几何编码体(MGEV),用于编码不适定区域和大幅差的粗粒度几何信息,同时保留细节和小幅差的细粒度几何信息。为了构建MGEV,我们引入了一个自适应补丁匹配模块,能够高效有效地计算大幅差范围和/或不适定区域的匹配代价。我们进一步提出一个选择性几何特征融合模块,以自适应地融合MGEV中的多范围和多粒度几何特征。然后,我们将融合的几何特征输入到ConvGRUs中,以迭代更新视差图。MGEV能够高效处理大幅差和不适定区域,如遮挡和无纹理区域,并在迭代过程中具有快速收敛性。我们的IGEV++在Scene Flow测试集上实现了所有视差范围内的最佳性能,最高达到768px。我们的IGEV++还在Middlebury、ETH3D、KITTI 2012和2015基准上实现了最先进的精度。具体而言,IGEV++在大幅差基准Middlebury上实现了3.23%的2像素异常值率(Bad 2.0),与RAFT-Stereo和GMStereo相比,误差分别降低了31.9%和54.8%。我们还提出了一种IGEV++的实时版本,在KITTI基准上实现了所有已发布实时方法中的最佳性能。
Keyword:
Large disparity
stereo matching
multi-range
dense correspondence
cost volume
iterative optimization
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W
机构
引用论文
Any-Stereo: Arbitrary Scale Disparity Estimation for Iterative Stereo MatchingAny-Stereo: 可变尺度视差估计用于迭代立体匹配
Learning Phrase Representations using RNN Encoder–Decoder for Statistical Machine Translation使用RNN编码器-解码器学习统计机器翻译的短语表示

