Skip to main content
QUICK REVIEW

[论文解读] Improved Stereo Matching with Constant Highway Networks and Reflective Confidence Learning

Amit Shaked, Lior Wolf|arXiv (Cornell University)|Dec 31, 2016
Advanced Vision and Imaging参考文献 22被引用 11
一句话总结

本文提出了一种新颖的立体匹配流程,通过使用具有多级跳跃连接的恒定高速公路网络以及用于训练置信度分数的反射损失,提升了精度和置信度估计。该方法在KITTI 2012和2015基准测试中取得了最先进性能,错误率分别为2.29%和3.42%,并在异常值检测与修正方面优于现有置信度估计技术。

ABSTRACT

We present an improved three-step pipeline for the stereo matching problem and introduce multiple novelties at each stage. We propose a new highway network architecture for computing the matching cost at each possible disparity, based on multilevel weighted residual shortcuts, trained with a hybrid loss that supports multilevel comparison of image patches. A novel post-processing step is then introduced, which employs a second deep convolutional neural network for pooling global information from multiple disparities. This network outputs both the image disparity map, which replaces the conventional "winner takes all" strategy, and a confidence in the prediction. The confidence score is achieved by training the network with a new technique that we call the reflective loss. Lastly, the learned confidence is employed in order to better detect outliers in the refinement step. The proposed pipeline achieves state of the art accuracy on the largest and most competitive stereo benchmarks, and the learned confidence is shown to outperform all existing alternatives.

研究动机与目标

  • 通过采用使用固定门控、多级跳跃连接的新型高速公路架构,重新设计深度匹配网络,以提升立体匹配精度。
  • 用能够同时预测视差图与置信度分数的深度卷积神经网络替代传统的'赢家通吃'策略。
  • 开发一种新型训练信号——反射损失,该损失在训练过程中根据预测正确性动态调整置信度标签。
  • 通过利用学习到的置信度分数,指导错误视差的插值,从而提升异常值检测与修正效果。
  • 在不依赖语义分割或额外训练数据的前提下,实现在大规模立体匹配基准上的最先进性能。

提出的方法

  • 引入一种恒定高速公路网络变体,采用固定门控值与多级残差快捷连接,以稳定训练过程并改善局部匹配中的特征传播。
  • 采用混合损失函数,在训练过程中实现图像块的多级比较,增强网络区分正确匹配的能力。
  • 使用第二个深度卷积神经网络同时预测最终的视差图与置信度分数,取代标准的WTA策略,实现可微分的、具备全局上下文感知能力的输出。
  • 在训练过程中应用新型反射损失,当预测视差正确时,置信度标签动态设为1,否则设为0,使网络能够学习可靠的置信度估计。
  • 在优化步骤中利用预测的置信度分数,通过邻近像素插值检测并修正异常值。
  • 引入缩放层以控制网络的感受野,提升匹配代价计算中的空间上下文建模能力。

实验结果

研究问题

  • RQ1与标准残差网络相比,使用多级跳跃连接的恒定门控高速公路网络是否能提升立体匹配精度?
  • RQ2将WTA策略替换为用于视差与置信度预测的深度卷积神经网络,是否能带来更好的性能与更可靠的置信度估计?
  • RQ3一种基于预测正确性动态分配置信度标签的反射损失函数,是否能优于传统置信度估计方法?
  • RQ4学习到的置信度分数如何提升立体匹配流程中的异常值检测与修正效果?
  • RQ5所提出的方法是否能在不使用语义分割或额外训练数据的情况下,实现在KITTI基准上的最先进结果?

主要发现

  • 所提方法在KITTI 2012上的测试错误率为2.29%,在KITTI 2015上为3.42%,优于MC-CNN基线(分别为2.43%与3.89%)及其他最先进方法。
  • 反射置信度损失在六种对比置信度估计技术中取得最高平均AUC(KITTI 2012为0.833,KITTI 2015为0.812)。
  • 该方法将快速立体匹配架构的错误率优化至2.63%(KITTI 2012)与3.78%(KITTI 2015),且推理时间控制在5秒以内。
  • 消融实验表明,若移除混合损失或恒定高速公路门控机制,性能将下降,证实了二者的重要性。
  • 通过反射损失学习到的置信度分数显著提升了异常值检测能力,使优化步骤中的插值更加准确。
  • 该方法在不使用语义分割的前提下实现了最先进性能,证明仅通过网络架构创新与置信度学习即可实现高精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。