[论文解读] Practical Stereo Matching via Cascaded Recurrent Network with Adaptive Correlation
该论文提出CREStereo,一种具有自适应相关性的级联循环立体匹配网络,以提升真实场景中的视差估计性能。通过采用分层循环细化、堆叠级联推理以及自适应组相关层,该方法在Middlebury和ETH3D基准上实现了最先进性能,同时在真实智能手机图像上显著优于先前方法,尤其在细节恢复和复杂纹理区域表现更优。
With the advent of convolutional neural networks, stereo matching algorithms have recently gained tremendous progress. However, it remains a great challenge to accurately extract disparities from real-world image pairs taken by consumer-level devices like smartphones, due to practical complicating factors such as thin structures, non-ideal rectification, camera module inconsistencies and various hard-case scenes. In this paper, we propose a set of innovative designs to tackle the problem of practical stereo matching: 1) to better recover fine depth details, we design a hierarchical network with recurrent refinement to update disparities in a coarse-to-fine manner, as well as a stacked cascaded architecture for inference; 2) we propose an adaptive group correlation layer to mitigate the impact of erroneous rectification; 3) we introduce a new synthetic dataset with special attention to difficult cases for better generalizing to real-world scenes. Our results not only rank 1st on both Middlebury and ETH3D benchmarks, outperforming existing state-of-the-art methods by a notable margin, but also exhibit high-quality details for real-life photos, which clearly demonstrates the efficacy of our contributions.
研究动机与目标
- 解决来自智能手机等消费级设备的真实立体图像中准确视差估计的挑战。
- 克服现有方法在细结构恢复、非理想校正以及复杂场景泛化能力方面的局限性。
- 通过设计新型训练数据集与网络架构,提升在细线结构、无纹理区域及非均匀光照条件下的性能。
- 在公开基准上实现最先进结果的同时,保持对真实生活照片的高质量预测。
提出的方法
- 提出一种具有分层细化的级联循环网络,以自粗到精的方式迭代优化视差。
- 引入堆叠级联架构以实现高分辨率推理,利用特征金字塔中的多级上下文信息。
- 设计自适应组相关层(AGCL),动态调整相关性分组,以减少非理想校正带来的误差。
- 采用共享权重的特征提取器,为各阶段的相关性计算生成多尺度特征。
- 使用循环更新模块(RUM),基于上下文感知特征迭代优化视差与光流偏移。
- 构建一个包含多样化光照、纹理与形状的新合成数据集,以提升对真实世界场景的泛化能力。
实验结果
研究问题
- RQ1具有分层细化的级联循环网络是否能提升在细结构与细线物体上的视差估计精度?
- RQ2自适应组相关层在缓解真实立体图像对中因校正不完美导致的误差方面效果如何?
- RQ3通过增强纹理与光照变化的合成数据集,在多大程度上能提升对真实世界场景的泛化能力?
- RQ4所提出的架构是否在标准基准与真实生活智能手机图像上均优于现有方法?
- RQ5该方法在真实立体数据中面对模糊、色彩偏移与视角变化等实际失真时,其鲁棒性如何?
主要发现
- CREStereo在Middlebury和ETH3D两个基准上均取得最高排名,全面超越所有先前的SOTA方法。
- 在ETH3D基准上,CREStereo在400张智能手机拍摄的场景中达到97.50% mxIoU与72.61% mxIoUbd,显著优于RAFT-Stereo(94.58%与69.26%)。
- 在KITTI 2012上,CREStereo在2像素误差阈值下的Out-Noc准确率较LEAStereo提升9.47%。
- 在Holopix50K上的定性结果表明,CREStereo在猫须、金属网等细线结构以及无纹理区域表现更优。
- 该方法在ETH3D上对实际干扰(如模糊、色彩变换与空间失真)表现出强鲁棒性。
- 所提出的合成数据集显著提升了对真实世界场景的泛化能力,尤其在无纹理与重复纹理区域表现更佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。