Skip to main content
QUICK REVIEW

[论文解读] DiffusionDepth: Diffusion Denoising Approach for Monocular Depth Estimation

Yiqun Duan, Xianda Guo|arXiv (Cornell University)|Mar 9, 2023
Advanced Vision and Imaging被引用 5
一句话总结

该论文提出 DiffusionDepth,一种新颖的基于扩散的去噪框架,用于单目深度估计。该框架通过在潜在空间中使用单目视觉引导,将随机初始化的深度图逐步优化为高分辨率、细节丰富的深度图。通过采用自扩散训练策略,即对自身优化后的预测结果进行去噪而非使用稀疏真实深度监督,该方法克服了模式崩溃问题,在 KITTI 和 NYU-Depth-V2 数据集上分别实现了 0.298 RMSE 和 1.452 RMSE 的最先进性能,同时在 ResNet 和 Swin 主干网络上分别保持了 14 FPS 和 5 FPS 的可行推理速度。

ABSTRACT

Monocular depth estimation is a challenging task that predicts the pixel-wise depth from a single 2D image. Current methods typically model this problem as a regression or classification task. We propose DiffusionDepth, a new approach that reformulates monocular depth estimation as a denoising diffusion process. It learns an iterative denoising process to `denoise' random depth distribution into a depth map with the guidance of monocular visual conditions. The process is performed in the latent space encoded by a dedicated depth encoder and decoder. Instead of diffusing ground truth (GT) depth, the model learns to reverse the process of diffusing the refined depth of itself into random depth distribution. This self-diffusion formulation overcomes the difficulty of applying generative models to sparse GT depth scenarios. The proposed approach benefits this task by refining depth estimation step by step, which is superior for generating accurate and highly detailed depth maps. Experimental results on KITTI and NYU-Depth-V2 datasets suggest that a simple yet efficient diffusion approach could reach state-of-the-art performance in both indoor and outdoor scenarios with acceptable inference time.

研究动机与目标

  • 通过将深度估计重新表述为扩散去噪过程,解决基于回归的单目深度估计方法存在的过拟合与细节恢复能力差等问题。
  • 解决在 KITTI 等数据集中常见的稀疏真实深度数据训练下生成模型的模式崩溃问题。
  • 通过在紧凑且学习得到的深度表征潜在空间中执行去噪过程,实现高分辨率深度预测。
  • 通过迭代优化捕捉场景的粗粒度与细粒度结构,提升深度图质量。
  • 证明扩散模型在生成之外的 3D 感知任务(特别是深度估计)中的可行性与有效性。

提出的方法

  • 该模型将单目深度估计建模为去噪扩散过程:通过单目视觉条件作为引导,将随机深度分布逐步优化为一致的深度图。
  • 去噪过程在由专用深度自编码器编码的潜在空间中进行,从而在降低计算成本的同时实现高分辨率输出。
  • 提出一种自扩散训练策略:不使用真实深度图进行扩散,而是逐步向模型自身优化后的深度预测结果添加噪声,并通过稀疏有效掩码施加监督。
  • 通过视觉主干网络(如 ResNet、Swin Transformer)提取的多尺度特征进行分层融合,并通过 FPN 聚合,以在每一步中引导去噪模块。
  • 在潜在空间中采用类似 U-Net 的架构,通过交叉注意力机制在去噪过程中关注视觉特征,实现精确的空间对齐。
  • 训练期间应用随机裁剪、抖动和翻转等数据增强策略,以提升泛化能力并增强对不完整监督的鲁棒性。

实验结果

研究问题

  • RQ1基于扩散的生成模型能否被有效适配于单目深度估计任务(该任务传统上通过回归或分类方法解决)?
  • RQ2当仅有稀疏真实深度监督可用时,如何有效训练扩散模型,以避免模式崩溃?
  • RQ3在潜在空间中进行迭代优化是否能生成比端到端回归方法更高分辨率、更细节丰富的深度图?
  • RQ4与在稀疏真实深度数据上使用标准扩散训练相比,所提出的自扩散训练策略在性能与稳定性方面表现如何?
  • RQ5该方法在不同视觉主干网络和不同深度监督格式(如基于分箱的监督)下的兼容性如何?

主要发现

  • DiffusionDepth 在 NYU-Depth-V2 数据集的官方离线测试划分下实现了 0.298 RMSE 的新 SOTA 性能,在 KITTI 数据集上达到 1.452 RMSE,表现优异。
  • 自扩散训练策略在稀疏真实深度数据上成功避免了模式崩溃,表现为训练稳定收敛且输出质量高,而标准扩散方法在稀疏真实深度数据上则表现不佳。
  • 在 RTX 3090 GPU 上,使用 20 步去噪过程,该模型在 ResNet 主干网络上实现 14 FPS 的推理速度,在 Swin Transformer 主干网络上实现 5 FPS,具备实际部署潜力。
  • 消融实验表明,使用更高分辨率的深度潜在空间(下采样率 ×2)相比 ×4 略有性能提升,表明保留空间细节的重要性。
  • 该框架兼容多种视觉主干网络,包括 CNN(Res34、Res50)和 Transformer(Swin),并能有效利用额外监督信号(如基于分箱的预测,例如 BinsFormer)。
  • 消融实验确认,随着去噪步数减少,模型性能下降;但通过针对特定推理步数(如 t=15)进行微调,可获得优于直接推理的结果,表明需要针对不同步数进行适配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。