Skip to main content
QUICK REVIEW

[论文解读] Beyond Photometric Loss for Self-Supervised Ego-Motion Estimation

Tianwei Shen, Zixin Luo|arXiv (Cornell University)|Feb 25, 2019
Advanced Vision and Imaging参考文献 51被引用 6
一句话总结

本文提出了一种用于单目自监督运动估计的框架,通过成对特征匹配与对极几何关系引入几何约束,改进了光度损失。通过引入基于几何一致性的匹配损失,该方法在KITTI数据集上实现了最先进性能,优于以往的无监督方法,甚至在序列09上超越了无回环检测的单目ORB-SLAM2。

ABSTRACT

Accurate relative pose is one of the key components in visual odometry (VO) and simultaneous localization and mapping (SLAM). Recently, the self-supervised learning framework that jointly optimizes the relative pose and target image depth has attracted the attention of the community. Previous works rely on the photometric error generated from depths and poses between adjacent frames, which contains large systematic error under realistic scenes due to reflective surfaces and occlusions. In this paper, we bridge the gap between geometric loss and photometric loss by introducing the matching loss constrained by epipolar geometry in a self-supervised framework. Evaluated on the KITTI dataset, our method outperforms the state-of-the-art unsupervised ego-motion estimation methods by a large margin. The code and data are available at https://github.com/hlzz/DeepMatchVO.

研究动机与目标

  • 解决自监督运动估计中光度损失的局限性,该损失因反光表面、遮挡和非朗伯表面而累积误差。
  • 通过特征匹配与对极几何的隐式几何监督,提升深度与位姿估计的鲁棒性与准确性。
  • 证明中间几何表示(如成对匹配)比像素级光度误差更能抵御光度伪影的影响。
  • 在无需回环检测或复杂辅助监督的情况下,实现优于最先进无监督方法的视觉里程计性能。
  • 通过简单且可扩展的端到端架构实现端到端训练,其在真实序列上的表现优于复杂基线方法。

提出的方法

  • 提出一种几何匹配损失,强制预测的特征匹配与对极几何约束保持一致。
  • 使用孪生卷积神经网络从相邻帧中提取特征,并计算它们之间的成对匹配。
  • 通过从预测的相对位姿推导出的基础矩阵,确保匹配点位于对应的对极线上,从而施加对极几何约束。
  • 在多任务学习框架中,将几何匹配损失与标准的光度重建损失相结合。
  • 采用百分位数掩码以减少光度损失中异常值的影响,提升训练稳定性。
  • 链式连接预测的相对位姿,并应用运动平均法以重建完整轨迹用于评估。

实验结果

研究问题

  • RQ1与仅使用光度损失相比,通过特征匹配推导出的几何约束是否能提升自监督运动估计的鲁棒性?
  • RQ2在存在遮挡和反光表面的具有挑战性的真实序列中,将对极几何整合到损失函数中会对性能产生何种影响?
  • RQ3在无需显式几何监督的情况下,中间几何表示(如成对匹配)在多大程度上能提升深度与位姿估计?
  • RQ4所提出的方法是否在标准基准(如KITTI)上优于最先进无监督方法,特别是在全轨迹估计方面?
  • RQ5仅使用简单端到端网络与几何监督,是否能超越传统方法(如无回环检测的ORB-SLAM2)?

主要发现

  • 在KITTI序列09上,该方法实现了18.36米的中位数绝对轨迹误差(ATE),优于无回环检测的单目ORB-SLAM2(38.56米)。
  • 在序列10上,该方法实现了16.15米的ATE,优于基线方法[50]的23.78米,且与更复杂的方法相当。
  • 匹配损失显著提升了基线自监督方法[50]的性能,甚至超越了使用光流或ICP进行监督的方法。
  • 在短片段评估(如3帧或5帧窗口)中,该方法表现优异,序列09的片段ATE为0.0089 ± 0.0054。
  • 该模型在处理大角度旋转运动时存在局限,可能是因为KITTI训练集中旋转数据不足。
  • 尽管使用了较小的输入分辨率(128×416)和简单架构,该方法仍实现了最先进性能,表明其具有强大的未来提升潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。