[论文解读] A Compromise Principle in Deep Monocular Depth Estimation
本文提出一种回归-分类级联网络(RCCN),通过应用‘折中原则’——在空间分辨率与深度分辨率之间取得平衡,以缓解优化困难。通过联合训练低分辨率连续深度分支与高分辨率离散深度分支,该方法在NYU Depth V2、KITTI和Make3D基准上实现了最先进性能,在关键指标上优于先前方法。
Monocular depth estimation, which plays a key role in understanding 3D scene geometry, is fundamentally an ill-posed problem. Existing methods based on deep convolutional neural networks (DCNNs) have examined this problem by learning convolutional networks to estimate continuous depth maps from monocular images. However, we find that training a network to predict a high spatial resolution continuous depth map often suffers from poor local solutions. In this paper, we hypothesize that achieving a compromise between spatial and depth resolutions can improve network training. Based on this "compromise principle", we propose a regression-classification cascaded network (RCCN), which consists of a regression branch predicting a low spatial resolution continuous depth map and a classification branch predicting a high spatial resolution discrete depth map. The two branches form a cascaded structure allowing the classification and regression branches to benefit from each other. By leveraging large-scale raw training datasets and some data augmentation strategies, our network achieves top or state-of-the-art results on the NYU Depth V2, KITTI, and Make3D benchmarks.
研究动机与目标
- 为解决单目深度估计的病态性问题,即高分辨率连续深度预测在训练过程中易陷入不良局部极小值。
- 通过假设空间分辨率与深度分辨率之间的折中可简化学习过程,从而提升深度网络的优化稳定性。
- 开发一种联合学习框架,同时利用连续与离散深度监督,以提升泛化能力与性能。
- 通过消融研究与变体在标准基准上的对比,验证折中原则的有效性。
提出的方法
- 提出一种具有双分支的级联深度网络架构:一个用于低空间分辨率连续深度的回归分支,一个用于高空间分辨率离散深度的分类分支。
- 对离散化深度区间使用分类损失,以提升训练稳定性并相比直接回归降低RMSE。
- 采用级联结构,其中分类分支将卷积层特征与低分辨率连续深度图作为输入。
- 应用数据增强与大规模原始数据集,以提升训练过程中的泛化能力与鲁棒性。
- 在训练后引入一个细化与融合网络,将离散深度图上采样至更高分辨率,同时保留空间细节。
- 使用联合损失函数端到端训练整个网络,以平衡两个分支的优化。
实验结果
研究问题
- RQ1在空间分辨率与深度分辨率之间进行折中,是否能提升单目深度估计中的训练稳定性和性能?
- RQ2将深度回归问题转化为使用离散深度区间的分类问题,是否能带来更优的优化效果与更低的RMSE?
- RQ3级联结构(其中回归分支支持分类分支)在多大程度上提升了深度估计的准确性?
- RQ4与移除低分辨率连续深度分支或仅使用分类分支的变体相比,所提出的RCCN架构表现如何?
- RQ5当仅在KITTI上进行训练时,该模型在训练中未见过的领域(如Cityscapes)上是否具备良好的泛化能力?”
主要发现
- 所提出的RCCN在NYU Depth V2基准上实现了最先进性能,其高分辨率离散深度预测显著优于先前方法。
- 在KITTI上,模型取得了具有竞争力的结果,尽管训练数据集不同,仍表现出对户外驾驶场景的强大泛化能力。
- 在Make3D上,该方法在所有误差指标(包括C1和C2误差)上均达到最先进水平,证实其在户外场景中的鲁棒性。
- 消融研究显示,若移除低分辨率连续深度分支(D0),两个分支的性能均下降,证明回归与分类分支之间存在相互增益。
- RCCN与分类-分类级联(CCCN)的对比表明,结合连续与离散监督优于仅使用离散监督。
- 在KITTI上训练的模型能良好泛化至Cityscapes,准确预测场景布局与物体深度,表明其具备强大的领域泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。