Skip to main content
QUICK REVIEW

[论文解读] RealMonoDepth: Self-Supervised Monocular Depth Estimation for General Scenes

Mertalp Ocal, Armin Mustafa|arXiv (Cornell University)|Apr 14, 2020
Advanced Vision and Imaging参考文献 63被引用 11
一句话总结

RealMonoDepth 提出了一种自监督单目深度估计方法,通过引入基于相对深度缩放和图像扭曲的新型损失函数,使模型能够在不同深度范围(1–100米以上)的多样化室内和室外场景中实现良好泛化。该方法可在不依赖固定基线的混合立体视觉与运动相机数据集上进行训练,从而在五个基准数据集上实现最先进性能,包括未见过的深度范围。

ABSTRACT

We present a generalised self-supervised learning approach for monocular estimation of the real depth across scenes with diverse depth ranges from 1--100s of meters. Existing supervised methods for monocular depth estimation require accurate depth measurements for training. This limitation has led to the introduction of self-supervised methods that are trained on stereo image pairs with a fixed camera baseline to estimate disparity which is transformed to depth given known calibration. Self-supervised approaches have demonstrated impressive results but do not generalise to scenes with different depth ranges or camera baselines. In this paper, we introduce RealMonoDepth a self-supervised monocular depth estimation approach which learns to estimate the real scene depth for a diverse range of indoor and outdoor scenes. A novel loss function with respect to the true scene depth based on relative depth scaling and warping is proposed. This allows self-supervised training of a single network with multiple data sets for scenes with diverse depth ranges from both stereo pair and in the wild moving camera data sets. A comprehensive performance evaluation across five benchmark data sets demonstrates that RealMonoDepth provides a single trained network which generalises depth estimation across indoor and outdoor scenes, consistently outperforming previous self-supervised approaches.

研究动机与目标

  • 解决现有自监督单目深度估计方法受限于固定深度范围和相机基线的问题。
  • 实现对室内与室外场景中深度尺度差异显著(1–100米以上)的泛化能力。
  • 开发一种结合立体图像对与真实世界运动相机序列的自监督训练框架,无需真实深度监督。
  • 在不依赖固定相机基线的前提下,保持精确的度量深度预测能力。

提出的方法

  • 提出一种新型损失函数,通过缩放与图像扭曲操作,结合相对深度监督与真实深度估计。
  • 采用尺度变换模块,利用场景特定的中位数深度缩放,从相对深度图中估计真实深度。
  • 使用图像重建作为监督信号:利用预测的深度将源视图扭曲以重建目标视图。
  • 在无真实深度监督的前提下,联合训练单个深度神经网络,数据来源包括立体数据集(如 KITTI)和真实世界运动相机数据集(如 Mannequin Challenge)。
  • 在训练过程中应用图像扭曲与光度一致性损失,以保证源视图与目标视图之间的几何一致性。
  • 使用相对深度网络预测归一化深度,再通过场景特定的中位数深度估计将其缩放为真实深度。

实验结果

研究问题

  • RQ1自监督单目深度估计能否在无需固定相机基线的情况下,泛化到深度范围差异极大的场景(如室内与室外)?
  • RQ2如何训练单个网络,以从未标定的真实世界视频序列和立体图像对中估计真实度量深度?
  • RQ3何种损失函数设计可实现有效的自监督训练,并在多样化场景中保持真实深度尺度?
  • RQ4结合立体图像对与运动相机数据在多大程度上提升了对未见深度范围的泛化能力与性能?

主要发现

  • RealMonoDepth 在五个基准数据集(包括 KITTI、NYU、TUM、Make3D 和 Mannequin Challenge)上均达到最先进性能,且在所有数据集上均显著优于以往自监督方法。
  • 在 MC+KITTI 混合数据集上联合训练的模型性能优于仅在单一数据集上训练的模型,表明其在不同深度范围上具有更强的泛化能力。
  • 在 KITTI 测试集上,该方法实现绝对相对误差(Abs Rel)为 0.388,均方根误差(RMS)为 1.533,优于 Monodepth2(Abs Rel: 0.427,RMS: 1.616)。
  • 消融实验表明,所提出的尺度变换(ST)模块在 NYU 和 TUM 等深度范围可变的数据集上显著提升性能,同时在 KITTI 上保持原有性能。
  • 使用所提损失函数训练的模型可泛化至未见过的场景,包括测试时的动态场景,尽管训练数据仅包含静态场景。
  • 定性结果表明,该方法在多样化场景中均能实现精确的深度估计,涵盖远距离室外场景(最远约 500 米)与近距离室内环境(约 10 米)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。