Skip to main content
QUICK REVIEW

[论文解读] Semi-Supervised Adversarial Monocular Depth Estimation

Rongrong Ji, Ke Li|arXiv (Cornell University)|Aug 6, 2019
Advanced Vision and Imaging被引用 5
一句话总结

本文提出了一种用于单目深度估计的半监督对抗学习框架,该框架利用少量图像-深度配对数据和大量未标注的RGB图像,实现了最先进性能。通过使用一个用于深度预测的生成器以及两个判别器——一个评估图像-深度对的真实性,另一个评估深度图的质量——该方法即使在标注数据有限的情况下也能显著提升精度,在NYUv2、Make3D以及领域自适应场景中均优于监督基线模型。

ABSTRACT

In this paper, we address the problem of monocular depth estimation when only a limited number of training image-depth pairs are available. To achieve a high regression accuracy, the state-of-the-art estimation methods rely on CNNs trained with a large number of image-depth pairs, which are prohibitively costly or even infeasible to acquire. Aiming to break the curse of such expensive data collections, we propose a semi-supervised adversarial learning framework that only utilizes a small number of image-depth pairs in conjunction with a large number of easily-available monocular images to achieve high performance. In particular, we use one generator to regress the depth and two discriminators to evaluate the predicted depth , i.e., one inspects the image-depth pair while the other inspects the depth channel alone. These two discriminators provide their feedbacks to the generator as the loss to generate more realistic and accurate depth predictions. Experiments show that the proposed approach can (1) improve most state-of-the-art models on the NYUD v2 dataset by effectively leveraging additional unlabeled data sources; (2) reach state-of-the-art accuracy when the training set is small, e.g., on the Make3D dataset; (3) adapt well to an unseen new dataset (Make3D in our case) after training on an annotated dataset (KITTI in our case).

研究动机与目标

  • 减少对大规模、昂贵的图像-深度配对数据集在单目深度估计中的依赖。
  • 在仅提供有限真实深度图的情况下,提升深度估计的准确性。
  • 利用大量、易于获取的未标注RGB图像,增强模型的泛化能力和性能。
  • 实现在无目标域标签的情况下,从标注的源域(如KITTI)到未标注目标域(如Make3D)的有效领域自适应。
  • 开发一种可与各种先进的深度估计生成器架构兼容的灵活框架。

提出的方法

  • 设计了一个生成对抗网络(GAN)框架,包含一个用于深度回归的生成器和两个用于反馈的判别器。
  • 配对判别器通过区分真实与虚假的图像-深度对,评估预测的图像-深度对的真实性。
  • 深度判别器单独评估预测深度图的合理性,确保其与真实深度图的分布一致。
  • 生成器通过来自两个判别器的联合损失进行训练,模拟贝叶斯后验:p(d|I) ∝ p(I|d)p(d)。
  • 在训练过程中使用未标注的RGB图像,为生成器提供输入,并从判别器获取反馈,而无需真实深度监督。
  • 该框架可与任何最先进的深度估计生成器架构兼容,例如Laina等人[2]或Eigen等人[1]提出的架构。

实验结果

研究问题

  • RQ1当仅有少量标注的图像-深度对时,半监督GAN框架是否能提升单目深度估计的准确性?
  • RQ2在缺乏额外监督的情况下,未标注的RGB图像在多大程度上能增强深度预测性能?
  • RQ3所提出的对抗框架是否能泛化到未见数据集,例如在无需在目标域标签上微调的情况下,实现从KITTI到Make3D的领域自适应?
  • RQ4双判别器设计——同时评估图像-深度对和深度图——是否能带来比单判别器或监督基线更优的深度质量?
  • RQ5当标注数据变得充足时,该半监督方法的性能上限是什么?

主要发现

  • 在NYUv2数据集上,所提方法通过利用额外的未标注图像,提升了现有最先进模型的性能,实现了更低的误差率。
  • 在Make3D数据集上,尽管训练数据有限,该方法仍达到了最先进精度,优于完全监督的基线模型。
  • 在从KITTI到Make3D的领域自适应中,使用KITTI图像-深度对以及400张未标注Make3D图像训练的模型,相对误差(rel)达到0.447,显著优于仅使用监督训练的模型。
  • 在某些情况下,模型生成的深度图比真实深度图更自然,因为真实深度图通常稀疏,需通过插值处理才能可视化。
  • 当已有足够标注数据时,该方法无法进一步提升性能,证实了半监督假设:未标注数据仅在标签稀缺时才有效。
  • 由于训练数据中存在缺陷深度标注(如来自Kinect传感器的标注),模型在玻璃和镜面区域表现不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。