[论文解读] Learning to Recover 3D Scene Shape from a Single Image
该论文提出了一种两阶段框架,通过先预测未知尺度和偏移的深度,再利用3D点云编码器预测缺失的深度偏移和焦距,从而从单张真实场景图像中恢复出精确的3D场景形状。该方法通过引入一种新型的图像级归一化回归损失和成对的表面法线回归损失,在九个未见过的数据集上实现了最先进的零样本泛化性能,实现了对混合多源数据的鲁棒训练。
Despite significant progress in monocular depth estimation in the wild, recent state-of-the-art methods cannot be used to recover accurate 3D scene shape due to an unknown depth shift induced by shift-invariant reconstruction losses used in mixed-data depth prediction training, and possible unknown camera focal length. We investigate this problem in detail, and propose a two-stage framework that first predicts depth up to an unknown scale and shift from a single monocular image, and then use 3D point cloud encoders to predict the missing depth shift and focal length that allow us to recover a realistic 3D scene shape. In addition, we propose an image-level normalized regression loss and a normal-based geometry loss to enhance depth prediction models trained on mixed datasets. We test our depth model on nine unseen datasets and achieve state-of-the-art performance on zero-shot dataset generalization. Code is available at: https://git.io/Depth
研究动机与目标
- 解决由于未知深度偏移和焦距导致的单目图像中3D场景形状重建不准确的关键问题。
- 克服现有单目深度模型中平移不变损失的局限性,这些局限性阻碍了度量3D形状的恢复。
- 通过利用在合成或扫描数据上训练的3D点云编码器,实现在未见数据集上的零样本泛化能力。
- 通过引入新型训练损失,提升在混合、多样化数据集上的单目深度估计性能,增强几何一致性与鲁棒性。
- 弥合基于图像的先验与基于3D点云的先验之间的域差距,以提升3D重建的保真度。
提出的方法
- 两阶段框架:首先,基于CNN的深度预测模块从单张图像中估计出未知尺度和偏移的深度图。
- 其次,3D点云重建模块利用学习到的点云编码器来预测缺失的深度偏移和焦距调整因子。
- 深度预测模型采用一种新型的图像级归一化回归损失进行训练,该损失将深度映射到一个规范化的、与尺度和偏移无关的空间,从而提升训练稳定性。
- 引入成对的表面法线回归损失以增强几何精度,特别是在边缘和平面区域,其采样策略根据数据质量进行定制。
- 该方法利用合成数据和3D扫描数据来训练点云编码器,相较于基于图像的先验,显著减小了域差距。
- 网络中增加一个辅助路径以输出逆深度,同时应用排序损失和归一化回归损失,以提升在多样化数据源上的泛化能力。
实验结果
研究问题
- RQ1当深度偏移和焦距未知时,纯数据驱动的方法能否从单张真实场景图像中恢复出精确的3D场景形状?
- RQ2在混合数据集训练中,如何缓解平移不变损失的影响,以实现度量3D重建?
- RQ3在合成或扫描数据上训练的3D点云编码器能否泛化到真实世界的真实场景中,用于形状优化?
- RQ4图像级归一化回归损失和基于表面法线的损失在异构数据集上对深度预测的提升程度如何?
- RQ5所提出的框架是否在多样化的未见数据集上实现了最先进的零样本泛化性能?
主要发现
- 所提方法在九个未见数据集上的零样本迁移任务中实现了最先进性能,展现出超越训练数据的强大泛化能力。
- 与仅使用标准深度预测相比,利用3D点云编码器预测深度偏移和焦距显著提升了3D形状的真实感与准确性。
- 图像级归一化回归损失通过标准化来自不同来源且未知尺度和偏移的深度分布,提升了在混合数据集上的训练鲁棒性。
- 成对的表面法线回归损失增强了几何保真度,尤其在边缘和平面区域表现更优,减少了重建3D形状中的伪影。
- 该框架成功地从多样化的现实场景图像中恢复出逼真的3D场景形状,其在未见数据上的定性结果验证了这一点。
- 该方法在低质量与高质量数据集上均表现出良好的泛化能力,显示出对深度监督质量差异的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。