Skip to main content
QUICK REVIEW

[论文解读] SfMLearner++: Learning Monocular Depth & Ego-Motion using Meaningful Geometric Constraints

Vignesh Prasad, Brojeshwar Bhowmick|arXiv (Cornell University)|Dec 20, 2018
Advanced Vision and Imaging被引用 6
一句话总结

SfMLearner++ 通过利用基础矩阵中的对极约束,提出了一种几何约束学习方法,用于单目深度和自身运动估计,从而在不使用复杂损失函数或大型网络的情况下提高了对应匹配的准确性。该方法以更少的参数实现了最先进性能,在 Cityscapes 和 Make3D 等未见数据集上展现出更优的泛化能力。

ABSTRACT

Most geometric approaches to monocular Visual Odometry (VO) provide robust pose estimates, but sparse or semi-dense depth estimates. Off late, deep methods have shown good performance in generating dense depths and VO from monocular images by optimizing the photometric consistency between images. Despite being intuitive, a naive photometric loss does not ensure proper pixel correspondences between two views, which is the key factor for accurate depth and relative pose estimations. It is a well known fact that simply minimizing such an error is prone to failures. We propose a method using Epipolar constraints to make the learning more geometrically sound. We use the Essential matrix, obtained using Nister's Five Point Algorithm, for enforcing meaningful geometric constraints on the loss, rather than using it as labels for training. Our method, although simplistic but more geometrically meaningful, using lesser number of parameters, gives a comparable performance to state-of-the-art methods which use complex losses and large networks showing the effectiveness of using epipolar constraints. Such a geometrically constrained learning method performs successfully even in cases where simply minimizing the photometric error would fail.

研究动机与目标

  • 该论文旨在通过解决朴素光度损失最小化方法的失败案例,改进单目深度和视觉里程计估计。
  • 旨在在不依赖显式运动掩码或复杂损失函数的前提下,提升学习对应关系的几何一致性。
  • 目标是使用基础矩阵构建一种更简单、更具几何意义的训练损失,以指导监督。
  • 旨在减少对大型网络和计算密集型损失的依赖,同时保持或提升性能。
  • 探讨对极约束是否能够有效替代或减少动态场景中对可解释性掩码的需求。

提出的方法

  • 该方法使用基础矩阵(通过 Nistér 的五点算法计算)在训练过程中对像素对应关系施加几何一致性约束。
  • 并非将基础矩阵作为真实值,而是利用其对光度损失进行加权,基于对极对齐程度,对错误对应关系施加更重惩罚。
  • 损失函数被修改,引入一个对极损失项,以最小化与对极约束的偏差:ˆ˜p^T E˜p。
  • 应用边缘感知平滑损失,以保留深度边界并提升输出清晰度。
  • 引入逆深度归一化以稳定训练过程,防止深度分布坍塌。
  • 最终损失结合了对极约束、深度归一化一致性与边缘感知平滑性,使模型在多样化场景中具备鲁棒性能。

实验结果

研究问题

  • RQ1对极约束能否作为深度学习中单目深度与自身运动估计的正则化信号有效使用?
  • RQ2与标准光度损失相比,将基础矩阵用作动态损失加权机制是否能提升对应关系的准确性?
  • RQ3是否能够通过更少参数的简化模型实现与使用复杂损失函数和更大网络架构的最先进方法相当的性能?
  • RQ4当仅在 KITTI 上训练时,该方法在未见数据集(如 Cityscapes 和 Make3D)上的泛化能力如何?
  • RQ5基于对极的监督是否能减少或消除动态场景中对显式运动掩码预测的需求?

主要发现

  • 该方法在 KITTI 测试集上实现了 0.175 的绝对相对误差(Abs Rel),优于 SfMLearner(无可解释性)的 0.221。
  • 该方法将 RMSE 从 SfMLearner 的 7.527 降低至 5.986,显著提升了深度估计精度。
  • 该模型在未见数据集上泛化良好:在 Cityscapes 上,其深度输出比 SfMLearner 更清晰,且无需微调。
  • 在 Make3D 上,该模型的深度质量优于 SfMLearner,表明其在非街道、户外场景中具备强大的零样本泛化能力。
  • 消融实验表明,将对极约束与逆深度归一化结合可获得最佳性能,最终模型的 δ < 1.253 准确率达到 0.967。
  • 对极掩码能有效识别运动物体(如骑行人、汽车),表明其可作为无需显式预测的运动掩码代理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。