Skip to main content
QUICK REVIEW

[论文解读] Adaptive Unimodal Cost Volume Filtering for Deep Stereo Matching

Youmin Zhang, Yimin Chen|arXiv (Cornell University)|Sep 9, 2019
Advanced Vision and Imaging参考文献 35被引用 17
一句话总结

该论文提出了一种新型的深度立体匹配框架——自适应单峰代价体积过滤(AcfNet),通过以真实视差为中心的单峰分布直接监督代价体积,同时为每个像素估计置信度以建模匹配不确定性。通过引入立体焦点损失并采用端到端训练,AcfNet在KITTI 2012和KITTI 2015基准上均取得最先进性能,分别排名第一和第四。

ABSTRACT

State-of-the-art deep learning based stereo matching approaches treat disparity estimation as a regression problem, where loss function is directly defined on true disparities and their estimated ones. However, disparity is just a byproduct of a matching process modeled by cost volume, while indirectly learning cost volume driven by disparity regression is prone to overfitting since the cost volume is under constrained. In this paper, we propose to directly add constraints to the cost volume by filtering cost volume with unimodal distribution peaked at true disparities. In addition, variances of the unimodal distributions for each pixel are estimated to explicitly model matching uncertainty under different contexts. The proposed architecture achieves state-of-the-art performance on Scene Flow and two KITTI stereo benchmarks. In particular, our method ranked the $1^{st}$ place of KITTI 2012 evaluation and the $4^{th}$ place of KITTI 2015 evaluation (recorded on 2019.8.20). The codes of AcfNet are available at: https://github.com/DeepMotionAIResearch/DenseMatchingBenchmark.

研究动机与目标

  • 为解决深度立体匹配中代价体积的欠约束问题,即通过视差回归进行间接监督会导致过拟合和代价体积质量差。
  • 通过将代价体积直接建模为以真实视差为中心的单峰分布,改善代价体积学习,提升匹配可靠性。
  • 通过估计置信度分数显式建模每个像素的匹配不确定性,从而控制单峰分布的锐度。
  • 通过在代价体积上使用新型立体焦点损失进行端到端训练,实现最先进水平的视差估计性能。

提出的方法

  • 该方法采用PSMNet风格的沙漏主干网络提取特征,并在特征聚合后生成三个代价体积。
  • 置信度估计网络(CENet)预测每个像素的置信度分数,用于调节每个像素的单峰真实分布的锐度。
  • 通过将高斯类似分布以真实视差为中心构建单峰代价体积标签,其方差由预测的置信度控制。
  • 在代价体积上直接应用立体焦点损失,促使网络学习到在正确视差处具有锐峰的代价分布。
  • 通过在过滤后的代价体积上使用软argmin进行视差回归,并结合标准回归损失实现端到端优化。
  • 该架构采用多尺度特征融合和3D残差块进行代价聚合,并通过转置卷积跳跃连接保留空间分辨率。

实验结果

研究问题

  • RQ1是否可以通过以真实视差为中心的单峰分布直接监督代价体积,来提升立体匹配的准确性?
  • RQ2通过学习的置信度分数显式建模每个像素的匹配不确定性,对代价体积质量和视差估计有何影响?
  • RQ3与通过视差回归进行间接监督相比,使用自适应单峰分布对代价体积进行过滤是否能减少过拟合并提升泛化能力?
  • RQ4所提出的立体焦点损失对代价体积学习和最终视差精度有何影响?

主要发现

  • AcfNet在KITTI 2012立体匹配基准中排名第一,优于评估时所有其他方法(记录于2019.8.20)。
  • 在KITTI 2015基准中,AcfNet排名第四,展现出在多样化真实世界立体数据集上的强大泛化能力。
  • 在Scene Flow上的消融实验表明,所提出的单峰过滤和基于置信度的调制显著提升了代价体积质量和视差精度。
  • 可视化结果表明,AcfNet生成的代价分布以真实视差为中心形成锐峰,而基线模型如PSMNet则常表现出虚假局部极小值。
  • 使用立体焦点损失显著提升了代价体积学习的鲁棒性,尤其在模糊或无纹理区域表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。