Skip to main content
QUICK REVIEW

[论文解读] SC-DepthV3: Robust Self-supervised Monocular Depth Estimation for Dynamic Scenes

Libo Sun, Jia-Wang Bian|arXiv (Cornell University)|Nov 7, 2022
Advanced Vision and Imaging被引用 4
一句话总结

SC-DepthV3 提出了一种鲁棒的自监督单目深度估计方法,通过利用预训练单图像深度模型生成的伪深度,实现对动态场景的准确估计。该方法引入了动态区域精化(DRR)和局部结构精化(LSR)模块,利用深度序数一致性与法向引导排序来提升物体边界处的精度与清晰度,在六个基准数据集上显著优于以往的自监督方法,包括具有挑战性的动态场景。

ABSTRACT

Self-supervised monocular depth estimation has shown impressive results in static scenes. It relies on the multi-view consistency assumption for training networks, however, that is violated in dynamic object regions and occlusions. Consequently, existing methods show poor accuracy in dynamic scenes, and the estimated depth map is blurred at object boundaries because they are usually occluded in other training views. In this paper, we propose SC-DepthV3 for addressing the challenges. Specifically, we introduce an external pretrained monocular depth estimation model for generating single-image depth prior, namely pseudo-depth, based on which we propose novel losses to boost self-supervised training. As a result, our model can predict sharp and accurate depth maps, even when training from monocular videos of highly-dynamic scenes. We demonstrate the significantly superior performance of our method over previous methods on six challenging datasets, and we provide detailed ablation studies for the proposed terms. Source code and data will be released at https://github.com/JiawangBian/sc_depth_pl

研究动机与目标

  • 解决视频训练中因动态物体和遮挡导致自监督单目深度估计性能下降的问题。
  • 在多视角一致性因遮挡而失效的物体边界处,提升深度图的清晰度。
  • 利用预训练模型生成的虽不完美但序数准确的伪深度,指导自监督学习,而无需真实标签。
  • 开发一种方法,在无需显式动态物体检测或复杂运动建模的前提下,保持对动态区域的高性能。
  • 证明即插即用的伪深度可被有效用于提升自监督深度估计,且附加计算成本极低。

提出的方法

  • 使用预训练的单目深度模型(LeReS)生成伪深度,作为自监督训练的单图像深度先验。
  • 提出动态区域精化(DRR)模块,通过置信度感知采样与深度排序损失,在动态与静态区域之间强制实现深度序数一致性。
  • 提出局部结构精化(LSR)模块,利用法向匹配损失与边缘引导的相对法向排序损失,保留局部几何结构。
  • 将光度一致性与几何一致性损失,与基于伪深度的新正则化项结合,提升训练稳定性和精度。
  • 采用多阶段训练策略,在保持自监督目标的同时引入伪深度监督。
  • 使用即插即用的伪深度推理,避免对外部模型进行微调或重新训练,从而最小化计算开销。

实验结果

研究问题

  • RQ1能否利用预训练单图像深度模型生成的伪深度,提升动态场景中的自监督深度估计性能?
  • RQ2即使伪深度的定量精度较低,能否仍有效用于增强自监督深度学习?
  • RQ3能否利用动态与静态区域之间的深度序数一致性,提升泛化能力与边界清晰度?
  • RQ4通过边缘引导损失引入法向信息,是否能实现更优的深度图局部结构保持?
  • RQ5所提方法能否在静态与高度动态的基准数据集上均超越当前最先进自监督方法?

主要发现

  • SC-DepthV3 在六个具有挑战性的数据集上达到最先进性能,包括 DDAD 和 IBims-1 等动态基准数据集,使用 LeReS(ResNet-101) 伪深度时在 DDAD 上的 AbsRel 达到 0.142。
  • 消融实验表明,若移除 DRR 或 LSR 模块,性能显著下降,证明了其有效性。
  • 该方法在动态区域与物体边界处显著优于以往自监督方法,如图 1 和图 5(d) 的定性结果所示。
  • 使用 LeReS(ResNet-101) 生成伪深度的效果优于 DPT 或 LeReS(ResNet-50),表明法向信息对齐的重要性。
  • 性能提升在动态与静态场景中均保持一致,证明了对场景复杂度的鲁棒性。
  • 即使伪深度精度较低,所提方法仍能实现高精度深度估计,证明序数一致性足以提供有效监督。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。