Skip to main content
QUICK REVIEW

[论文解读] Displacement-Invariant Cost Computation for Efficient Stereo Matching

Yiran Zhong, Charles Loop|arXiv (Cornell University)|Dec 1, 2020
Advanced Vision and Imaging参考文献 32被引用 7
一句话总结

本文提出了一种位移不变的成本计算模块,通过在视差偏移的特征对上使用二维卷积,消除了对四维特征体素的需求,实现了超过100 FPS的实时立体匹配,且精度达到当前最先进水平。该方法实现了优异的跨数据集泛化能力,并通过学习直接的像素级匹配,避免了对语义上下文的依赖。

ABSTRACT

Although deep learning-based methods have dominated stereo matching leaderboards by yielding unprecedented disparity accuracy, their inference time is typically slow, on the order of seconds for a pair of 540p images. The main reason is that the leading methods employ time-consuming 3D convolutions applied to a 4D feature volume. A common way to speed up the computation is to downsample the feature volume, but this loses high-frequency details. To overcome these challenges, we propose a \emph{displacement-invariant cost computation module} to compute the matching costs without needing a 4D feature volume. Rather, costs are computed by applying the same 2D convolution network on each disparity-shifted feature map pair independently. Unlike previous 2D convolution-based methods that simply perform context mapping between inputs and disparity maps, our proposed approach learns to match features between the two images. We also propose an entropy-based refinement strategy to refine the computed disparity map, which further improves speed by avoiding the need to compute a second disparity map on the right image. Extensive experiments on standard datasets (SceneFlow, KITTI, ETH3D, and Middlebury) demonstrate that our method achieves competitive accuracy with much less inference time. On typical image sizes, our method processes over 100 FPS on a desktop GPU, making our method suitable for time-critical applications such as autonomous driving. We also show that our approach generalizes well to unseen datasets, outperforming 4D-volumetric methods.

研究动机与目标

  • 解决依赖四维特征体素的基于3D卷积的立体匹配方法所面临的高计算成本和内存需求问题。
  • 克服现有基于2D卷积的方法依赖上下文映射而非立体图像间直接特征匹配的局限性。
  • 实现实时推理(100+ FPS),适用于自动驾驶等时间敏感的应用,同时不牺牲精度。
  • 通过减少对3D体素模型学习到的数据集特定虚假相关性的依赖,提升跨数据集泛化能力。
  • 开发一种精炼策略,避免在右图像上计算第二个视差图,从而降低内存占用和推理时间。

提出的方法

  • 对每个视差偏移的特征图对独立应用相同的2D卷积网络来计算匹配成本,避免显式构建四维特征体素。
  • 采用位移不变设计,确保所有视差水平下成本计算的一致性,从而实现高效且参数高效的训练。
  • 利用从三维成本体素中提取的熵图作为置信度图,指导视差精炼,减少对右视图视差估计的需求。
  • 对整个网络(包括成本计算和精炼)进行端到端训练,以优化最终视差精度。
  • 利用基于熵的置信度图进行视差精炼,避免在右图像上进行冗余计算,提升速度和效率。
  • 在标准数据集(SceneFlow、KITTI、ETH3D、Middlebury)上进行训练,并在未见过的数据集上评估泛化性能,无需微调。

实验结果

研究问题

  • RQ1基于2D卷积的方法是否能在不构建四维特征体素的情况下实现具有竞争力的立体匹配精度?
  • RQ2与基于3D体素的方法相比,位移不变的成本计算模块是否能实现更快的推理速度,同时保持高精度?
  • RQ3与学习数据集特定偏差的3D体素模型相比,所提方法是否能在未见数据集上实现更好的泛化能力?
  • RQ4该方法在随机点立体图(RDS)上的表现是否表明其具备真正的像素匹配能力,而非依赖语义上下文?
  • RQ5基于熵的置信度图是否能有效指导视差精炼,而无需在右图像上计算第二个视差图?

主要发现

  • 该方法在桌面GPU上对540p图像实现了超过100 FPS的推理速度,显著优于通常仅运行在~2 FPS左右的基于3D卷积的方法。
  • 在KITTI 2015测试集上,该方法实现了1.70的EPE和42.35%的bad-1.0,性能与当前最先进方法相当或更优,同时速度快得多。
  • 在跨数据集泛化测试中,该方法在Middlebury 2014和KITTI 2015上均优于3D体素基线模型(Baseline3D),EPE和bad-1.0误差率更低。
  • 在随机点立体图(RDS)数据集上,该方法实现了1.02的EPE和5.45%的bad-1.0,证明了其具备真正的像素匹配能力;而MADNet [19]则完全失效,EPE高达51.21。
  • 基于熵的精炼策略通过消除在右图像上计算第二个视差图的需求,显著降低了推理时间和内存占用。
  • 该方法在未见过的数据集上表现出良好的泛化能力,在多个基准测试中性能一致,表明其学习的是鲁棒的匹配模式,而非数据集特定的伪影。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。