Skip to main content
QUICK REVIEW

[论文解读] Stereo Risk: A Continuous Modeling Approach to Stereo Matching

Ce Liu, Suryansh Kumar|arXiv (Cornell University)|Jul 3, 2024
Spectroscopy and Chemometric AnalysesChemistry被引用 3
一句话总结

Stereo Risk 提出了一种用于立体匹配的连续风险最小化框架,用 $L^1$-范数风险最小化替代了传统的离散化视差回归,该方法基于从分类视差分布推导出的连续概率密度函数。通过利用隐函数定理实现可微分优化,该方法在 KITTI、ETH3D 和 Middlebury 基准测试中实现了最先进性能,尤其在多模态和易受异常值影响的视差估计中显著提升了准确性。

ABSTRACT

We introduce Stereo Risk, a new deep-learning approach to solve the classical stereo-matching problem in computer vision. As it is well-known that stereo matching boils down to a per-pixel disparity estimation problem, the popular state-of-the-art stereo-matching approaches widely rely on regressing the scene disparity values, yet via discretization of scene disparity values. Such discretization often fails to capture the nuanced, continuous nature of scene depth. Stereo Risk departs from the conventional discretization approach by formulating the scene disparity as an optimal solution to a continuous risk minimization problem, hence the name "stereo risk". We demonstrate that $L^1$ minimization of the proposed continuous risk function enhances stereo-matching performance for deep networks, particularly for disparities with multi-modal probability distributions. Furthermore, to enable the end-to-end network training of the non-differentiable $L^1$ risk optimization, we exploited the implicit function theorem, ensuring a fully differentiable network. A comprehensive analysis demonstrates our method's theoretical soundness and superior performance over the state-of-the-art methods across various benchmark datasets, including KITTI 2012, KITTI 2015, ETH3D, SceneFlow, and Middlebury 2014.

研究动机与目标

  • 解决深度立体匹配中离散视差量化方法的局限性,后者无法捕捉真实世界深度的连续特性。
  • 克服基于 $L^2$ 的期望最小化对多模态视差分布和异常值的敏感性。
  • 开发一种可微分、端到端可训练的框架,实现在不依赖离散回归或后处理的前提下进行连续视差预测。
  • 通过将视差建模为连续风险最小化问题,提升在域偏移(如合成数据到真实数据)下的泛化能力。
  • 在真实世界立体匹配基准测试中实现优越性能,同时保持高效的推理速度和参数效率。

提出的方法

  • 将立体匹配表述为连续风险最小化问题,其中视差预测是使在连续概率密度函数上期望 $L^1$ 误差最小化的解。
  • 通过基于样条插值的方法对离散的视差假设分类分布进行插值,构建连续概率密度函数。
  • 应用 $L^1$-范数风险最小化,以找到使期望绝对误差最小的视差值,从而提升对多模态分布的鲁棒性。
  • 利用隐函数定理实现通过非可微 $L^1$ 优化步骤的梯度反向传播,支持端到端训练。
  • 在推理阶段采用基于二分查找的算法,高效计算最优视差值,确保计算效率。
  • 将 $L^1$ 风险最小化模块作为即插即用的层集成到现有立体网络中,无需额外可学习参数。

实验结果

研究问题

  • RQ1与标准的离散回归或基于期望的方法相比,连续风险最小化框架是否能提升立体匹配的准确性?
  • RQ2在处理多模态视差分布和异常值时,$L^1$-范数风险最小化与基于 $L^2$ 的期望最小化相比表现如何?
  • RQ3尽管存在非光滑性,是否能够使基于 $L^1$ 的风险最小化实现可微分和端到端可训练?
  • RQ4与现有最先进方法相比,该方法在域偏移(如从合成数据到真实世界数据)下的泛化能力是否更强?
  • RQ5与现有 SOTA 立体网络相比,该方法在计算效率和参数效率方面表现如何?

主要发现

  • 在 Middlebury 2014 基准测试中,Stereo Risk 将 >1px 错误率从 SOTA 的 13.76% 降低至 12.63%,表明其在准确性和高频细节恢复方面表现更优。
  • 在 ETH3D 上,>0.5px 错误率从 10.39% 降至 8.59%,>1px 错误率从 4.05% 降至 2.71%,表明其具备强大的泛化能力和对域偏移的鲁棒性。
  • 在 KITTI 2012 上,Stereo Risk 实现最佳性能,>2px 错误率为 5.82%,Noc All 为 3.84%,在无需微调的情况下超越 IGEV 和 DLNR。
  • 在 KITTI 2015 上,该方法实现 3.68% Noc All 和 5.19% D1_all,在无额外预训练的情况下排名所有方法之首。
  • 消融实验表明,无论是否仅替换预测头,训练和推理阶段均使用 $L^1$-范数风险最小化可获得最佳性能。
  • 该方法保持了高效的推理速度,参数量少于 PCWNet、IGEV 和 DLNR,且风险模块中无额外可学习参数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。