Skip to main content
QUICK REVIEW

[论文解读] Deep Stereo Matching with Dense CRF Priors

Ron Slossberg, Aaron Wetzler|arXiv (Cornell University)|Dec 6, 2016
Advanced Vision and Imaging参考文献 17被引用 4
一句话总结

本文提出了一种用于立体匹配的端到端深度学习框架,该框架在CNN架构中集成了一个密集连接的条件随机场(CRF)作为可学习的正则化先验。通过与网络参数联合训练CRF,该方法在保持更清晰的物体边界和减少伪影方面实现了更优的视差估计性能,在合成数据集(FlyingThings3D)和真实世界数据集(KITTI)上均优于非端到端及其它端到端基线方法。

ABSTRACT

Stereo reconstruction from rectified images has recently been revisited within the context of deep learning. Using a deep Convolutional Neural Network to obtain patch-wise matching cost volumes has resulted in state of the art stereo reconstruction on classic datasets like Middlebury and Kitti. By introducing this cost into a classical stereo pipeline, the final results are improved dramatically over non-learning based cost models. However these pipelines typically include hand engineered post processing steps to effectively regularize and clean the result. Here, we show that it is possible to take a more holistic approach by training a fully end-to-end network which directly includes regularization in the form of a densely connected Conditional Random Field (CRF) that acts as a prior on inter-pixel interactions. We demonstrate that our approach on both synthetic and real world datasets outperforms an alternative end-to-end network and compares favorably to more hand engineered approaches.

研究动机与目标

  • 解决依赖手工设计后处理步骤的非端到端立体匹配流程的局限性。
  • 通过将结构化先验整合到深度学习流程中,提升视差估计的精度和边界锐度。
  • 证明在端到端训练中使用可学习的密集CRF可获得优于标准CNN基成本体积学习的效果。
  • 探究整体性、可微分的正则化模块是否能优于模块化、顺序式的立体匹配流程。
  • 评估该方法在具有不同数据分布和视差范围的合成与真实世界数据集上的鲁棒性。

提出的方法

  • 该方法使用深度卷积神经网络(CNN)从立体图像对中计算基于图像块的匹配成本体积。
  • 将一个可学习的、密集连接的条件随机场(CRF)作为可微分层集成,利用像素间相互作用对成本体积进行正则化。
  • CRF采用一种新颖的兼容性函数,更有效地建模视差邻域关系。
  • 整个网络,包括CRF参数,通过使用可微分的平均场近似进行反向传播实现端到端训练。
  • CRF作为分段平滑先验,能在保持物体边界不连续性的同时强制实现局部平滑。
  • 该框架在合成数据集(FlyingThings3D)和真实世界数据集(KITTI)上使用完整图像监督进行训练。

实验结果

研究问题

  • RQ1当集成到端到端深度学习流程中时,可微分的、可学习的密集CRF层是否能提升立体匹配性能?
  • RQ2将像CRF这样的结构化先验整合进来,是否能带来优于仅依赖CNN基成本体积的视差估计效果?
  • RQ3在训练数据有限的数据集中,特别是在大视差区域,该方法表现如何?
  • RQ4所提出的基于CRF的正则化是否能减少SGM方法中常见的条纹伪影?
  • RQ5CRF先验带来的性能提升是否随着数据集规模和数据覆盖范围的增加而扩大?

主要发现

  • 在FlyingThings3D数据集上,所提方法在多个示例中实现了低于[23]的误差率,报告误差率为9.68%,而[23]为11.85%。
  • 在KITTI 2015数据集上,该方法在8个测试场景中的6个场景中优于[23],误差率分别为1.09%与1.45%(在某一情形下)。
  • 该方法减少了SGM方法中常见的条纹伪影,生成了更精细的细节和更锐利的边界。
  • 在KITTI数据集中,对于近距离物体且视差较大的区域,模型表现较差,误差率高达25.46%,原因是此类区域的训练样本不足。
  • 该方法在如FlyingThings3D这类大而覆盖充分的数据集上表现出显著改进,表明其性能随数据规模增加而具有强可扩展性。
  • 可学习CRF先验的引入相比不可微分或后处理替代方案,实现了更整体且更有效的正则化策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。