Skip to main content
QUICK REVIEW

[论文解读] CamLessMonoDepth: Monocular Depth Estimation with Unknown Camera Parameters

Sai Shyam Chanduri, Zeeshan Khan Suri|arXiv (Cornell University)|Oct 27, 2021
Advanced Vision and Imaging被引用 5
一句话总结

该论文提出 CamLessMonoDepth,一种自监督单目深度估计方法,通过未校准的图像序列隐式学习针孔相机内参,同时估计深度和位姿,采用高效的亚像素卷积实现高分辨率深度图与像素级不确定性估计。该方法在 KITTI 基准上实现最先进性能,无需真实相机参数,支持在多样化互联网视频上进行训练。

ABSTRACT

Perceiving 3D information is of paramount importance in many applications of computer vision. Recent advances in monocular depth estimation have shown that gaining such knowledge from a single camera input is possible by training deep neural networks to predict inverse depth and pose, without the necessity of ground truth data. The majority of such approaches, however, require camera parameters to be fed explicitly during training. As a result, image sequences from wild cannot be used during training. While there exist methods which also predict camera intrinsics, their performance is not on par with novel methods taking camera parameters as input. In this work, we propose a method for implicit estimation of pinhole camera intrinsics along with depth and pose, by learning from monocular image sequences alone. In addition, by utilizing efficient sub-pixel convolutions, we show that high fidelity depth estimates can be obtained. We also embed pixel-wise uncertainty estimation into the framework, to emphasize the possible applicability of this work in practical domain. Finally, we demonstrate the possibility of accurate prediction of depth information without prior knowledge of camera intrinsics, while outperforming the existing state-of-the-art approaches on KITTI benchmark.

研究动机与目标

  • 实现无需预标定相机参数的单目深度估计,克服现有自监督方法的关键局限。
  • 从单目图像序列中隐式学习相机内参,避免对真实校准数据的依赖。
  • 通过解码器中基于高效亚像素卷积的上采样方法,提升深度图质量。
  • 集成像素级不确定性估计,增强在自动驾驶等实际应用中的鲁棒性。
  • 在多样化、未校准的野外数据上实现泛化能力,包括具有不同相机设置和条件的互联网视频。

提出的方法

  • 该方法基于单目视频序列的自监督学习框架,联合训练深度神经网络以预测深度、位姿和相机内参。
  • 采用最小重投影损失和自动掩码机制处理遮挡和静态像素,提升在动态场景中的鲁棒性。
  • 在深度解码器中使用高效亚像素卷积网络(ESPCN)进行特征图上采样,生成更清晰、更高分辨率的深度预测。
  • 模型引入异方差式随机不确定性估计,实现每像素的置信度预测,提升决策任务中的可靠性。
  • 相机内参作为网络端到端预测的一部分,无需显式输入校准参数。
  • 训练流程结合 KITTI 2015 数据与来自 57 条道路场景视频的 7,623 张互联网来源图像,实现稳健的泛化能力。

实验结果

研究问题

  • RQ1能否在无需任何真实相机内参的情况下准确实现单目深度估计?
  • RQ2通过自监督训练隐式学习相机参数,是否能提升在野外未校准数据上的泛化能力?
  • RQ3与标准插值方法相比,高效亚像素卷积是否能显著提升深度图的分辨率与清晰度?
  • RQ4像素级不确定性估计是否能提升模型在真实部署场景中的可靠性?
  • RQ5模型能否在不使用真实监督或在线微调的情况下,于 KITTI 上实现最先进性能?

主要发现

  • 该模型在自监督单目深度估计的 KITTI 基准上实现最先进性能,即使未使用真实相机内参。
  • 解码器中使用 ESPCN 显著提升了深度图的清晰度,尤其在高分辨率下,优于标准插值方法。
  • 模型在未见数据上泛化良好,包括具有不同相机高度、分辨率和天气条件的互联网视频。
  • 定性结果表明,与基线模型 MonoDepth2 相比,边界和细长物体的重建效果更优。
  • 不确定性估计虽未显著提升深度预测精度,但为下游任务提供了宝贵的置信度信息。
  • 在输入分辨率为 1024×320 时性能最佳,且优于其他不使用在线微调或真实数据的最先进自监督方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。