Skip to main content
QUICK REVIEW

[论文解读] Geo-Supervised Visual Depth Prediction

Xiaohan Fei, Alex Wong|arXiv (Cornell University)|Jul 30, 2018
Advanced Vision and Imaging参考文献 45被引用 4
一句话总结

本文提出了一种利用重力作为监督信号的地理监督视觉深度预测方法,以提升单目深度估计性能。通过强制地理参考物体(如道路、建筑物)的表面法线与重力对齐或正交,该方法利用可学习的、类别感知的正则化器增强了深度预测,在KITTI和VISMA基准上实现了最先进性能,且推理时无需语义分割。

ABSTRACT

We propose using global orientation from inertial measurements, and the bias it induces on the shape of objects populating the scene, to inform visual 3D reconstruction. We test the effect of using the resulting prior in depth prediction from a single image, where the normal vectors to surfaces of objects of certain classes tend to align with gravity or be orthogonal to it. Adding such a prior to baseline methods for monocular depth prediction yields improvements beyond the state-of-the-art and illustrates the power of gravity as a supervisory signal.

研究动机与目标

  • 通过将惯性测量中的全局方向作为监督信号,提升单目深度预测性能。
  • 开发一种方法,选择性地对地理参考物体类别(如道路、建筑物)应用基于重力的先验,以提高深度估计精度。
  • 证明重力作为全局一致的参考,可在自监督深度学习中充当强有力的正则化器。
  • 在多种基准上验证该方法,包括KITTI和室内VISMA数据集,在不同运动条件下进行评估。
  • 通过与视觉-惯性里程计(VIO)系统集成,实现在移动设备和手持设备上的部署。

提出的方法

  • 该方法端到端训练深度神经网络,从单张图像和相机坐标系中的重力估计值预测视差。
  • 在训练过程中,使用语义分割掩码识别出地理参考物体(如道路、建筑物)区域,并应用类别特定的正则化器。
  • 正则化器通过可微分损失项,强制这些物体的表面法线与重力对齐或正交。
  • 在立体训练中,使用校准后的立体图像对,并选择性地在地理参考类别上应用可微分损失函数。
  • 在单目视频训练中,最小化重投影误差的同时,引入由重力诱导的法线正则化项。
  • 该方法被集成到现有最先进模型(如GeoNet、OursVIO)中,并扩展支持VIO,实现实时、手持设备部署。

实验结果

研究问题

  • RQ1在缺乏显式3D监督的情况下,重力能否作为单目深度预测的有效监督信号?
  • RQ2强制表面法线与重力对齐如何提升标准基准上的深度预测精度?
  • RQ3该方法在具有复杂运动和有限视差的挑战性室内环境中是否具备泛化能力?
  • RQ4在结合视觉-惯性里程计(VIO)时,基于重力的正则化是否能提升性能?
  • RQ5尽管训练中使用了语义分割,该方法是否可在推理时无需语义分割直接应用?

主要发现

  • 在KITTI基准上,所提方法优于最先进方法,单目深度预测的相对误差(AbsRel)为0.356,均方根误差(RMSE)为4.517。
  • 在VISMA室内数据集上,OursVIO++模型的AbsRel为0.105,RMSE为0.421,显著优于基线模型GeoNet(AbsRel: 0.157,RMSE: 0.518)。
  • 该方法在KITTI和VISMA上所有指标上均表现出一致提升,包括δ<1.25、δ<1.25²和δ<1.25³的准确率。
  • 定性结果表明,重力先验能有效减少孔洞,并改善椅背、墙壁等平面表面的深度估计,尤其在极端视角下表现更优。
  • 消融研究证实,即使与基于VIO的姿态估计结合,基于重力的正则化器仍对性能提升有显著贡献。
  • 该方法在未见领域上泛化良好,表现为直接将KITTI训练的模型应用于Make3D数据集而无需微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。