Skip to main content
QUICK REVIEW

[论文解读] SAFENet: Self-Supervised Monocular Depth Estimation with Semantic-Aware Feature Extraction

Jaehoon Choi, Dongki Jung|arXiv (Cornell University)|Oct 6, 2020
Advanced Vision and Imaging参考文献 61被引用 32
一句话总结

SAFENet 通过在多任务学习中整合语义感知深度特征,提升自监督单目深度估计,在 KITTI 上达到最先进结果并在恶劣条件下具有更好的泛化能力。

ABSTRACT

Self-supervised monocular depth estimation has emerged as a promising method because it does not require groundtruth depth maps during training. As an alternative for the groundtruth depth map, the photometric loss enables to provide self-supervision on depth prediction by matching the input image frames. However, the photometric loss causes various problems, resulting in less accurate depth values compared with supervised approaches. In this paper, we propose SAFENet that is designed to leverage semantic information to overcome the limitations of the photometric loss. Our key idea is to exploit semantic-aware depth features that integrate the semantic and geometric knowledge. Therefore, we introduce multi-task learning schemes to incorporate semantic-awareness into the representation of depth features. Experiments on KITTI dataset demonstrate that our methods compete or even outperform the state-of-the-art methods. Furthermore, extensive experiments on different datasets show its better generalization ability and robustness to various conditions, such as low-light or adverse weather.

研究动机与目标

  • 通过利用语义信息,在没有真实深度数据的情况下推动深度估计的改进。
  • 通过多任务学习开发语义感知的深度特征,以缓解光度损失的局限性。
  • 设计具有任务特定组件和共享组件的编码器,以降低深度和分割任务之间的干扰。
  • 提供跨任务信息通路,将语义相似性注入到深度特征中。
  • 展示在低光照和恶劣天气条件下的鲁棒性与泛化能力。

提出的方法

  • 提出一个多任务网络,具有共享编码器和用于深度与分割任务的两个解码器。
  • 通过专用模块(CPU 与 APU)将深度表示与语义信息结合,使用语义感知深度特征。
  • 通过从分割特征学习的语义亲和矩阵(APU)引导深度特征,融入语义亲和传播。
  • 应用任务特定的残差适配器和 SE 模块,允许任务共享和任务特定的特征学习而不产生干扰。
  • 通过 1x1 卷积融合跨任务信息,以实现深度解码器与分割解码器之间的可控特征共享。
  • 以自监督光度损失、深度平滑损失和语义分割损失进行训练,实现端到端优化。

实验结果

研究问题

  • RQ1语义感知特征提取是否能在自监督单目深度估计中超越仅用光度损失的性能?
  • RQ2如何构建多任务学习,以在共享有用表征的同时最小化深度与语义分割任务之间的干扰?
  • RQ3在低光、雾、雨等挑战性条件下,语义感知深度特征是否比仅深度方法具有更好的泛化?
  • RQ4在 KITTI 上以及跨数据集泛化(Virtual KITTI、nuScenes)中,语义监督对深度精度有什么影响?

主要发现

  • SAFENet 在 KITTI 上在自监督单目深度估计中实现了最先进的结果,而无需真实深度数据。
  • SAFENet 以 1024x320 输入在 KITTI 上达到 Abs Rel 0.106、Sq Rel 0.743、RMSE 4.489,以及 delta<1.25 0.884,优于若干基线。
  • 与带 SE 模块的 Monodepth2 相比,语义感知深度特征在 vKITTI 上对恶劣天气(雾、雨)下的鲁棒性有所提升。
  • 在不同数据集和条件下,SAFENet 展现出更好的泛化能力,并在光照或天气变化削弱 RGB 信号时仍维持深度质量。
  • 消融研究表明,CPU(深度到语义特征共享)和 APU(亲和传播)两者均有贡献,全部模块化共享达到最佳结果。
  • 按类别的分析表明,除了天空类别外,大多数语义类别的深度精度有所提升,且对移动对象的处理也有所改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。