Skip to main content
QUICK REVIEW

[论文解读] StereoNet: Guided Hierarchical Refinement for Real-Time Edge-Aware Depth Prediction

Sameh Khamis, Sean Fanello|arXiv (Cornell University)|Jul 24, 2018
Advanced Vision and Imaging参考文献 43被引用 13
一句话总结

StereoNet 提出了一种端到端的深度学习架构,通过使用低分辨率代价体积和分层优化,实现实时、边缘感知的深度预测。通过利用亚像素匹配精度和由彩色输入引导的可学习边缘感知上采样函数,该方法在 Titan X 上实现了 60 fps 的推理速度,同时生成高质量、无量化误差的视差图,在实时应用中达到最先进精度。

ABSTRACT

This paper presents StereoNet, the first end-to-end deep architecture for real-time stereo matching that runs at 60 fps on an NVidia Titan X, producing high-quality, edge-preserved, quantization-free disparity maps. A key insight of this paper is that the network achieves a sub-pixel matching precision than is a magnitude higher than those of traditional stereo matching approaches. This allows us to achieve real-time performance by using a very low resolution cost volume that encodes all the information needed to achieve high disparity precision. Spatial precision is achieved by employing a learned edge-aware upsampling function. Our model uses a Siamese network to extract features from the left and right image. A first estimate of the disparity is computed in a very low resolution cost volume, then hierarchically the model re-introduces high-frequency details through a learned upsampling function that uses compact pixel-to-pixel refinement networks. Leveraging color input as a guide, this function is capable of producing high-quality edge-aware output. We achieve compelling results on multiple benchmarks, showing how the proposed method offers extreme flexibility at an acceptable computational budget.

研究动机与目标

  • 在计算资源受限的条件下实现实时立体匹配,生成高精度深度图,尤其适用于 AR/VR 和移动应用。
  • 克服传统立体匹配方法依赖高分辨率代价体积和缓慢优化所导致的计算效率低下问题。
  • 在保持或提升精度的同时,降低模型复杂度和推理时间,相较于先前基于深度学习的立体匹配方法。
  • 开发一种分层优化机制,通过彩色引导的上采样方法保留边缘并恢复高频细节。
  • 证明在结合亚像素精确匹配和边缘感知优化的前提下,低分辨率代价体积足以实现高精度深度预测。

提出的方法

  • 网络采用孪生结构,从左右立体图像中提取特征。
  • 在下采样因子为 8 的条件下构建低分辨率代价体积,以亚像素精度编码匹配代价。
  • 通过一系列可学习的、边缘感知的上采样层,应用分层优化,逐步恢复高频细节。
  • 每个优化阶段使用紧凑的像素到像素优化网络,由彩色图像引导,以保留边缘并避免模糊。
  • 该方法利用深度网络的高亚像素匹配精度,实现全分辨率视差图,而无需全分辨率代价体积。
  • 整个流程端到端训练,最终输出为无量化误差的视差图。

实验结果

研究问题

  • RQ1深度神经网络能否实现足够高的亚像素匹配精度,从而仅通过低分辨率代价体积实现高精度深度预测?
  • RQ2可学习的边缘感知上采样能否替代传统插值或滤波方法,以保留视差图中的精细结构?
  • RQ3使用极低分辨率代价体积是否能显著降低计算成本,同时保持或提升相比先前方法的精度?
  • RQ4结合彩色引导的分层优化策略能否实现实时、高质量、边缘保留的输出?
  • RQ5缺乏监督训练数据在多大程度上限制性能?自监督学习能否缓解此问题?

主要发现

  • StereoNet 在 NVIDIA Titan X 上实现 60 fps 推理,是首个实现实时端到端立体匹配的高精度深度预测网络。
  • 网络实现了 1/30 像素的亚像素匹配精度,比传统立体匹配方法高出一个数量级。
  • 在 KITTI 2012 上,StereoNet 在非遮挡区域的 EPE 为 0.8,在所有像素上的 EPE 为 0.9,单对立体图像的推理时间仅为 0.015 秒。
  • 在 KITTI 2015 上,其所有像素的 EPE 为 4.83%,在速度上优于 MC-CNN 和 SGM-Net 等方法,同时保持了具有竞争力的精度。
  • 大部分推理时间(38%)集中在全分辨率下的最终优化阶段,表明优化是主要计算瓶颈。
  • 模型在反光表面和遮挡区域表现较差,这是由于缺乏相关训练数据且无图像修复机制所致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。