Skip to main content
QUICK REVIEW

[论文解读] Learning Depth via Leveraging Semantics: Self-supervised Monocular Depth Estimation with Both Implicit and Explicit Semantic Guidance

Rui Li, Xiantuo He|arXiv (Cornell University)|Feb 11, 2021
Advanced Vision and Imaging参考文献 46被引用 9
一句话总结

本文提出一种自监督单目深度估计方法,通过结合隐式与显式语义引导来提升深度预测精度。通过引入语义感知空间特征对齐(SSFA)模块和语义引导排序损失,该方法借助语义感知特征对齐与鲁棒的边缘感知监督,实现了在KITTI数据集上的最先进性能,AbsRel为0.103,RMSE为4.471。

ABSTRACT

Self-supervised depth estimation has made a great success in learning depth from unlabeled image sequences. While the mappings between image and pixel-wise depth are well-studied in current methods, the correlation between image, depth and scene semantics, however, is less considered. This hinders the network to better understand the real geometry of the scene, since the contextual clues, contribute not only the latent representations of scene depth, but also the straight constraints for depth map. In this paper, we leverage the two benefits by proposing the implicit and explicit semantic guidance for accurate self-supervised depth estimation. We propose a Semantic-aware Spatial Feature Alignment (SSFA) scheme to effectively align implicit semantic features with depth features for scene-aware depth estimation. We also propose a semantic-guided ranking loss to explicitly constrain the estimated depth maps to be consistent with real scene contextual properties. Both semantic label noise and prediction uncertainty is considered to yield reliable depth supervisions. Extensive experimental results show that our method produces high quality depth maps which are consistently superior either on complex scenes or diverse semantic categories, and outperforms the state-of-the-art methods by a significant margin.

研究动机与目标

  • 解决当前自监督深度估计方法忽视场景语义的问题,避免在复杂或罕见物体类别中产生不准确的深度预测。
  • 通过将语义信息作为隐式与显式监督整合,提升几何推理能力与上下文一致性,从而改善深度估计性能。
  • 克服训练与推理过程中语义标签噪声或不精确带来的挑战,确保在真实场景中的鲁棒性。
  • 通过利用类别特定的深度先验,实现在包括前景与背景物体在内的各类语义类别中的一致性能提升。

提出的方法

  • 提出语义感知空间特征对齐(SSFA)模块,通过强制同一语义类别内深度分布一致、跨类别间差异显著,实现深度与语义特征的对齐。
  • 设计语义引导排序损失,基于语义边界采样跨边点四元组,以在物体内部实现平滑深度、在物体边界实现锐利过渡。
  • 采用鲁棒的点对采样策略,考虑语义标签噪声与预测不确定性,通过不确定性感知加权提升采样可靠性。
  • 使用二值语义掩码(而非完整分割)作为输入,降低对高质量语义标注的依赖,提升模型在不同领域的泛化能力。
  • 在图像序列上以自监督方式训练深度网络,语义监督在特征层与损失层注入。
  • 利用跨域语义标签(如Cityscapes与VOC)评估泛化能力,表明即使在完整分割mIoU较低时,二值mIoU仍保持较高水平。

实验结果

研究问题

  • RQ1通过特征对齐实现的隐式语义引导是否能提升复杂场景中多样化语义类别下的深度估计精度?
  • RQ2通过排序损失实现的显式语义监督是否能通过强制类别特定的深度一致性与物体边界处的锐利深度边缘,提升深度图质量?
  • RQ3该方法在训练与推理过程中对噪声或不准确的语义标签是否具备鲁棒性?
  • RQ4当使用低质量或跨域语义标签时,该方法在多大程度上具备跨域泛化能力?
  • RQ5结合隐式与显式语义引导是否能在包括背景与罕见物体类别在内的所有语义类别中实现一致的性能提升?

主要发现

  • 所提方法在KITTI数据集上达到0.103的AbsRel与4.471的RMSE,显著优于当前最先进自监督方法。
  • 该方法在所有语义类别中均提升深度估计性能,包括前景(如行人、交通标志)与背景(如天空、围栏、墙壁)类别,类别特定的AbsRel改进显著。
  • 语义引导采样策略在识别真实跨边界点对方面达到75.2%的准确率,较直接采样方法(55.3%)高出19.9%。
  • 即使存在错误的语义标签(如将石头误分类为墙壁或标签缺失),该方法仍能生成准确的深度图,展现出强鲁棒性。
  • 模型对跨域语义标签具有良好的泛化能力:尽管完整分割mIoU较低(67.73 vs. 79.90),二值mIoU仍保持较高水平(93.54% vs. 94.74%),性能接近全监督版本。
  • SSFA模块有效利用语义上下文提升深度估计,尤其在二值掩码中未直接可见的区域,表明其具备丰富的上下文特征学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。