Skip to main content
QUICK REVIEW

[论文解读] On the Importance of Stereo for Accurate Depth Estimation: An Efficient Semi-Supervised Deep Neural Network Approach

Nikolai Smolyanskiy, A. Kamenev|arXiv (Cornell University)|Mar 26, 2018
Advanced Vision and Imaging参考文献 30被引用 6
一句话总结

该论文提出了一种半监督深度立体神经网络,结合了LIDAR和光度一致性损失,以实现高精度深度估计,采用了一种新型的机器学习argmax层和自定义运行时以实现高效推理。该方法在KITTI 2015数据集上表现出色,尤其在恢复LIDAR遗漏的细节方面表现优异,并在嵌入式GPU上实现了接近实时的推理速度(20 fps)。

ABSTRACT

We revisit the problem of visual depth estimation in the context of autonomous vehicles. Despite the progress on monocular depth estimation in recent years, we show that the gap between monocular and stereo depth accuracy remains large$-$a particularly relevant result due to the prevalent reliance upon monocular cameras by vehicles that are expected to be self-driving. We argue that the challenges of removing this gap are significant, owing to fundamental limitations of monocular vision. As a result, we focus our efforts on depth estimation by stereo. We propose a novel semi-supervised learning approach to training a deep stereo neural network, along with a novel architecture containing a machine-learned argmax layer and a custom runtime (that will be shared publicly) that enables a smaller version of our stereo DNN to run on an embedded GPU. Competitive results are shown on the KITTI 2015 stereo dataset. We also evaluate the recent progress of stereo algorithms by measuring the impact upon accuracy of various design criteria.

研究动机与目标

  • 为弥合单目与立体深度估计之间的持久精度差距,特别是在自动驾驶车辆中的应用。
  • 解决单目深度的根本局限,例如绝对深度的模糊性以及缺乏度量尺度。
  • 开发一种高效的立体网络,实现在嵌入式硬件上的实时运行,从而支持在自动驾驶系统中的部署。
  • 通过结合稀疏LIDAR和光度一致性进行半监督训练,提升对细粒度细节(如栅栏立柱)的恢复能力。
  • 分析架构选择和损失函数对立体深度精度的影响。

提出的方法

  • 提出一种新颖的半监督训练框架,结合基于LIDAR的监督信号与立体图像对之间的光度一致性损失。
  • 网络采用特征拼接后的代价体积,并结合3D卷积来建模图像对之间的视差。
  • 采用机器学习的argmax层替代标准argmax,以生成更平滑的视差图并提升泛化能力。
  • 基于TensorRT和cuDNN的自定义运行时加速推理,实现在Jetson TX2等嵌入式GPU上的实时性能。
  • 网络架构经过优化以提升效率,小型变体在Titan XP上实现约20 fps的推理速度,并在Jetson TX2上实现高效推理。
  • 在KITTI 2015立体基准数据集上,使用真实LIDAR数据和立体对之间的光度一致性对模型进行微调。

实验结果

研究问题

  • RQ1结合LIDAR和光度损失的半监督训练是否能显著提升立体深度估计的精度,相比仅使用监督学习的方法?
  • RQ2与标准argmax相比,学习型argmax层在视差图平滑性和细节恢复方面有多大的提升?
  • RQ3是否能够高效地在嵌入式GPU上部署深度立体网络,同时保持高精度和实时性能?
  • RQ4如代价体积构建方式和3D卷积等架构选择如何影响最终的深度估计精度?
  • RQ5半监督学习是否能更好地恢复细粒度几何结构(如栅栏条)?这些结构常被稀疏LIDAR遗漏。

主要发现

  • 所提出的半监督方法在KITTI 2015立体基准测试中取得了具有竞争力的结果,在关键指标上优于当前最先进方法。
  • 网络能够恢复如栅栏条和立柱等细粒度细节,这些特征常被LIDAR和仅使用LIDAR训练的模型所遗漏。
  • 通过基于TensorRT的自定义运行时,在Titan XP GPU上实现了约20 fps的接近实时推理速度。
  • 自定义运行时使嵌入式硬件(如Jetson TX2)上的高效推理成为可能,而使用标准TensorFlow运行时则难以实现。
  • 机器学习的argmax层生成了更平滑的视差图,并在泛化能力上优于标准argmax。
  • 该网络在多样化场景下表现稳健,能够准确估计车辆、骑行者、建筑物、树木和路面等物体的深度,即使在低纹理区域(如白色卡车内部)也能保持精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。