Skip to main content
QUICK REVIEW

[论文解读] DESC: Domain Adaptation for Depth Estimation via Semantic Consistency

Adrian Lopez-Rodriguez, Krystian Mikolajczyk|arXiv (Cornell University)|Sep 3, 2020
Advanced Vision and Imaging被引用 4
一句话总结

本文提出 DESC,一种用于单目深度估计的领域自适应方法,通过利用语义一致性和实例级大小先验生成未标注目标域中的伪标签。通过在主深度模型与基于语义和边缘特征训练的辅助模型之间强制保持一致性,DESC 在 Virtual KITTI 到 KITTI 和 Cityscapes 到 KITTI 基准上实现了最先进性能,绝对相对误差最高降低 9.8%。

ABSTRACT

Accurate real depth annotations are difficult to acquire, needing the use of special devices such as a LiDAR sensor. Self-supervised methods try to overcome this problem by processing video or stereo sequences, which may not always be available. Instead, in this paper, we propose a domain adaptation approach to train a monocular depth estimation model using a fully-annotated source dataset and a non-annotated target dataset. We bridge the domain gap by leveraging semantic predictions and low-level edge features to provide guidance for the target domain. We enforce consistency between the main model and a second model trained with semantic segmentation and edge maps, and introduce priors in the form of instance heights. Our approach is evaluated on standard domain adaptation benchmarks for monocular depth estimation and show consistent improvement upon the state-of-the-art.

研究动机与目标

  • 为解决获取精确深度标注的挑战,因为这成本高昂且需要 LiDAR 等专用传感器。
  • 通过利用源域中的语义标注,在缺乏深度标注的目标域中提升单目深度估计性能。
  • 通过语义一致性和基于实例的深度先验,弥合合成(源)数据集与真实(目标)数据集之间的领域差距。
  • 在目标域中无需立体或视频监督的情况下,提升深度估计性能。

提出的方法

  • 利用预训练的全景分割模型从目标域提取语义和边缘特征以提供指导。
  • 利用从源域学习到的实例级大小先验,在目标域中生成深度伪标签。
  • 在主深度估计网络与一个从语义和边缘图预测深度的辅助网络之间引入一致性损失。
  • 采用可学习标量自适应缩放一致性损失,提升在领域偏移下的泛化能力。
  • 结合自监督深度损失和语义一致性损失训练主模型。
  • 采用双分支架构,其中辅助网络在语义和边缘输入上进行训练,以强制与主模型保持结构一致性。

实验结果

研究问题

  • RQ1在无目标域深度标注的领域自适应设置下,源域与目标域之间的语义一致性是否能提升深度估计性能?
  • RQ2将实例级大小先验作为伪标签用于目标域中的深度估计,其有效性如何?
  • RQ3在主深度模型与基于语义和边缘特征训练的模型之间强制保持一致性,是否能提升在领域偏移下的泛化能力?
  • RQ4所提方法在多大程度上优于现有的单目深度估计领域自适应方法?
  • RQ5该方法是否能在无需额外监督的情况下,泛化到如 Virtual KITTI 到 KITTI 和 Cityscapes 到 KITTI 等多样化数据集?

主要发现

  • 在 Virtual KITTI 到 KITTI 基准上,DESC 相较于最先进方法将绝对相对误差(Sq Rel)降低了 9.8%。
  • 在 Cityscapes 到 KITTI 基准上,DESC 相较于 T 2 Net 将绝对相对误差降低了 13.9%,展现出强大的领域泛化能力。
  • 消融研究显示,与语义引导网络的一致性项对性能提升有显著贡献。
  • DESC 在仅需单张图像推理的情况下,优于使用三帧优化的 Struct2Depth (M+R)。
  • 即使不使用 ImageNet 预训练,该方法仍能达到最先进性能,且在相同设置下优于 Monodepth2。
  • 定性结果表明,与 T 2 Net 和 GASDA 相比,预测深度图的几何完整性得到改善,尤其在车辆和电线杆等物体上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。