Skip to main content
QUICK REVIEW

[论文解读] Monocular Depth Estimation with Augmented Ordinal Depth Relationships

Yuanzhouhan Cao, Tianqi Zhao|arXiv (Cornell University)|Jun 2, 2018
Advanced Vision and Imaging参考文献 44被引用 5
一句话总结

该论文提出了一种新颖的单目深度估计方法,通过利用立体电影视频中的相对深度关系,引入了RDIS数据集,该数据集包含密集标注的相对深度。通过在RDIS上预训练ResNet,并在RGB-D数据集上使用基于分类的深度估计方法结合信息增益损失进行微调,该方法在NYUD2和KITTI基准上实现了最先进性能,且无需多尺度架构或CRF后处理。

ABSTRACT

Most existing algorithms for depth estimation from single monocular images need large quantities of metric groundtruth depths for supervised learning. We show that relative depth can be an informative cue for metric depth estimation and can be easily obtained from vast stereo videos. Acquiring metric depths from stereo videos is sometimes impracticable due to the absence of camera parameters. In this paper, we propose to improve the performance of metric depth estimation with relative depths collected from stereo movie videos using existing stereo matching algorithm. We introduce a new "Relative Depth in Stereo" (RDIS) dataset densely labelled with relative depths. We first pretrain a ResNet model on our RDIS dataset. Then we finetune the model on RGB-D datasets with metric ground-truth depths. During our finetuning, we formulate depth estimation as a classification task. This re-formulation scheme enables us to obtain the confidence of a depth prediction in the form of probability distribution. With this confidence, we propose an information gain loss to make use of the predictions that are close to ground-truth. We evaluate our approach on both indoor and outdoor benchmark RGB-D datasets and achieve state-of-the-art performance.

研究动机与目标

  • 通过利用来自立体视频的丰富且易获取的相对深度监督,提升单目深度估计性能。
  • 解决现有RGB-D数据集中度量深度监督稀缺且多样性有限的问题。
  • 开发一种利用相对深度作为强归纳偏差的训练方案,以促进度量深度预测。
  • 创建一个新数据集RDIS,其包含来自立体电影视频的密集标注相对深度。
  • 证明通过迁移学习将相对深度监督与度量监督结合,可显著提升度量深度估计性能。

提出的方法

  • 通过在对数空间中将连续深度值离散化为离散区间,将深度估计建模为像素级分类任务。
  • 在包含通过立体匹配算法和人工后处理生成的相对深度标注的RDIS数据集上预训练深度残差网络(ResNet)。
  • 使用度量真实值深度在标准RGB-D数据集(NYUD2、KITTI)上对预训练模型进行微调。
  • 引入信息增益损失,以利用分类头输出的概率分布中的预测置信度,重点关注接近真实值的预测。
  • 在微调过程中仅使用立体对中的左图像,避免推理时需要立体输入。
  • 该方法不依赖多尺度架构或CRF后处理,但仍实现了最先进性能。

实验结果

研究问题

  • RQ1从立体视频中提取的相对深度关系是否能显著提升单目深度估计性能?
  • RQ2具有置信度感知损失的分类式深度估计方法是否优于标准回归式方法?
  • RQ3在大规模相对深度数据集(RDIS)上进行预训练是否能提升在度量深度估计基准上的泛化能力?
  • RQ4在RDIS上训练的模型是否能在未在DIW数据集上微调的情况下,良好泛化到其他相对深度数据集(如DIW)?
  • RQ5在真实场景中,相对深度监督在多大程度上可以补偿度量深度监督的缺乏?

主要发现

  • 所提方法在NYUD2和KITTI基准上,所有四项评估指标均实现了最先进性能,且未使用多尺度网络或CRF后处理。
  • 在NYUD2上,该方法在所有四项指标(如Abs Rel、Sq Rel、RMSE和δ<1.25)上均取得最佳结果,信息增益损失中的参数α = 2.0。
  • 在KITTI上,当最大深度限制在80米和50米时,该方法均优于所有先前工作,α = 0.2,表明其在室外场景中具有强大泛化能力。
  • 仅在RDIS上微调的模型(Ours-RDIS)在DIW数据集上的相对深度估计任务中也达到了最先进性能,即使未在DIW的训练集上进行任何训练。
  • 定性结果表明,该模型生成的深度预测在视觉上更优,尤其在具有细微深度变化的复杂场景中表现更佳。
  • 在DIW上的失败案例主要源于真实值对模糊,其距离几乎相等,表明在其余样本上性能接近完美。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。