Skip to main content
QUICK REVIEW

[论文解读] Camera Height Doesn't Change: Unsupervised Training for Metric Monocular Road-Scene Depth Estimation

Genki Kinoshita, Ko Nishino|arXiv (Cornell University)|Dec 7, 2023
Advanced Vision and Imaging被引用 4
一句话总结

该论文提出StableCamH,一种新颖的无监督单目深度估计框架,通过学习到的尺寸先验从外观中推断车辆尺寸,并将这些线索聚合为单一的不变度量——相机高度,从而在无需任何辅助传感器或尺度监督的情况下实现度量深度估计。该方法通过在帧与训练周期之间优化相机高度,实现了KITTI和Cityscapes数据集上的最先进性能,确保了稳定且具备尺度感知能力的深度预测。

ABSTRACT

In this paper, we introduce a novel training method for making any monocular depth network learn absolute scale and estimate metric road-scene depth just from regular training data, i.e., driving videos. We refer to this training framework as FUMET. The key idea is to leverage cars found on the road as sources of scale supervision and to incorporate them in network training robustly. FUMET detects and estimates the sizes of cars in a frame and aggregates scale information extracted from them into an estimate of the camera height whose consistency across the entire video sequence is enforced as scale supervision. This realizes robust unsupervised training of any, otherwise scale-oblivious, monocular depth network so that they become not only scale-aware but also metric-accurate without the need for auxiliary sensors and extra supervision. Extensive experiments on the KITTI and the Cityscapes datasets show the effectiveness of FUMET, which achieves state-of-the-art accuracy. We also show that FUMET enables training on mixed datasets of different camera heights, which leads to larger-scale training and better generalization. Metric depth reconstruction is essential in any road-scene visual modeling, and FUMET democratizes its deployment by establishing the means to convert any model into a metric depth estimator.

研究动机与目标

  • 通过利用道路场景中物体尺寸的先验知识,解决无监督单目深度估计中的尺度模糊问题。
  • 克服因定位不准确和真实场景中领域偏移导致的直接物体尺寸先验的脆弱性。
  • 开发一种自监督训练框架,使任意单目深度估计器具备尺度感知能力,而无需依赖GPS、IMU或深度传感器。
  • 通过在帧与训练周期之间强制实施相机高度不变性,实现在视频序列中的一致性深度估计。
  • 构建一个可泛化的、预训练的尺寸先验,仅从外观中估计车辆尺寸,可在无需人工标注的情况下跨数据集使用。

提出的方法

  • 将单目深度估计建模为相机高度优化问题,将相机高度视为视频序列中所有帧的共享不变物理度量。
  • 引入一个可微分的相机高度计算模块,从预测的深度图中推导出未缩放的相机高度估计值。
  • 使用一种新颖的可学习尺寸先验网络,直接从物体外观预测车辆尺寸(长度、宽度、高度),并在包含标注尺寸的网络抓取汽车图像上进行训练。
  • 应用轮廓投影器从深度图中提取物体轮廓高度,并与可学习尺寸先验的预测结果进行比较,以计算每帧的尺度因子。
  • 通过将尺度因子应用于未缩放的相机高度,计算每帧的缩放后相机高度估计值,从而实现度量监督。
  • 使用中值运算和加权移动平均,在所有帧和训练周期之间优化相机高度,以强制实现不变性并稳定训练过程。

实验结果

研究问题

  • RQ1能否在视频序列中利用相机高度不变性作为自监督信号,以解决单目深度估计中的尺度模糊问题?
  • RQ2如何使物体尺寸先验对真实驾驶场景中的定位误差和领域偏移具有鲁棒性?
  • RQ3在无需人工标注的情况下,基于网络抓取数据训练的基于学习的尺寸先验能否准确仅从外观预测车辆尺寸?
  • RQ4与固定伪监督相比,在训练过程中在线优化相机高度是否能提升深度估计精度?
  • RQ5所提出的框架能否泛化至任意单目深度估计模型,并在KITTI和Cityscapes等多样化数据集上有效运行?

主要发现

  • StableCamH在KITTI和Cityscapes基准上均实现了最先进水平的绝对尺度深度估计性能,优于现有弱监督方法。
  • 采用在线相机高度优化训练的模型相比固定伪监督获得了更高精度,证明了端到端不变性学习的有效性。
  • 微调相机高度策略进一步提升了性能,表明额外预训练可增强精度。
  • 可学习尺寸先验在跨数据集间表现出强鲁棒性,其尺寸估计的绝对相对误差低于固定先验,且与对比模型MonoCInIS相当。
  • 在KITTI数据集上,可学习尺寸先验的误差低于固定先验(1.59m)和MonoCInIS,尤其在未见领域中表现更优。
  • 该方法实现了完全无监督训练,无需深度或尺度监督,适用于任意真实场景驾驶视频。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。