Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised 3D Keypoint Learning for Ego-motion Estimation

Jiexiong Tang, Rareş Ambruş|arXiv (Cornell University)|Dec 7, 2019
Robotics and Sensor-Based Localization参考文献 67被引用 9
一句话总结

本文提出了一种自监督框架,直接从无标签的单目视频中学习深度感知的3D关键点,通过基于Procrustean残差姿态校正的可微分SfM模块,联合优化关键点检测、描述子学习与3D提升。该方法在KITTI基准上实现了最先进的单目视觉里程计性能,其尺度漂移极小,优于基于立体的方法。

ABSTRACT

Detecting and matching robust viewpoint-invariant keypoints is critical for visual SLAM and Structure-from-Motion. State-of-the-art learning-based methods generate training samples via homography adaptation to create 2D synthetic views with known keypoint matches from a single image. This approach, however, does not generalize to non-planar 3D scenes with illumination variations commonly seen in real-world videos. In this work, we propose self-supervised learning of depth-aware keypoints directly from unlabeled videos. We jointly learn keypoint and depth estimation networks by combining appearance and geometric matching via a differentiable structure-from-motion module based on Procrustean residual pose correction. We describe how our self-supervised keypoints can be integrated into state-of-the-art visual odometry frameworks for robust and accurate ego-motion estimation of autonomous vehicles in real-world conditions.

研究动机与目标

  • 解决在无需昂贵真实标注的情况下,学习对视角不变的鲁棒3D关键点以用于单目视觉里程计的挑战。
  • 克服现有自监督关键点学习方法依赖平面同调假设的局限性,这些方法在存在光照变化的非平面3D场景中表现不佳。
  • 通过单目视频序列中的时间一致性和几何一致性,以端到端的自监督方式联合优化关键点检测、描述子学习与3D提升。
  • 将学习到的3D关键点集成到最先进的视觉里程计框架(如DSO)中,实现准确、具备尺度感知能力的长距离自身运动估计。
  • 通过在KITTI视觉里程计序列和HPatches数据集上进行广泛评估,证明方法在真实世界自动驾驶场景中的泛化能力。

提出的方法

  • 利用时间视频序列,通过多视角几何一致性创建自监督监督信号,避免依赖合成同调矩阵。
  • 通过基于Procrustean残差姿态校正的可微分SfM模块,联合训练关键点检测网络与深度估计网络,以回归SE3相机位姿。
  • 通过可微分的姿态优化步骤最小化多视角间的重投影误差,以强制实现几何一致性,将预测的3D关键点对齐到其2D投影。
  • 使用结合外观匹配(通过描述子相似性)与几何约束(通过3D-2D重投影)的可微分损失函数,训练端到端系统。
  • 将学习到的3D关键点检测器与描述子集成到直接稀疏里程计(DSO)框架中,实现鲁棒的单目自身运动估计。
  • 在评估期间应用一次Sim(3)对齐步骤,将估计轨迹与真实轨迹对齐,以在KITTI基准上实现公平比较。

实验结果

研究问题

  • RQ1从无标签的单目视频中进行自监督3D关键点学习,是否能在存在光照和视角变化的真实条件下,实现鲁棒且可重复的关键点检测与匹配?
  • RQ2在单目视觉里程计中,关键点检测、描述子学习与深度估计的联合优化是否优于解耦或有监督的方法?
  • RQ3基于Procrustean残差姿态校正的可微分SfM模块是否能有效强制实现几何一致性并提升位姿估计精度?
  • RQ4在长距离单目视觉里程计中,所提自监督3D关键点系统的性能是否优于基于立体的最先进方法?
  • RQ5所学习的3D关键点在KITTI视觉里程计基准上的评估中,其在真实世界自动驾驶场景中的泛化能力如何?

主要发现

  • 在KITTI视觉里程计序列09和10上,该方法实现了4.30%的平均平移RMSE,优于单目监督下的SfMLearner(16.6%)和Zhan等人(12.3%)。
  • 在相同序列上,该方法实现了0.90°/100m的旋转RMSE,显著低于SfMLearner(3.26°/100m)和Zhan等人(3.52°/100m)。
  • 当集成到DSO中时,该方法在KITTI序列上实现了0.26%的平均平移RMSE,表明在长距离跟踪中具有极小的尺度漂移和高精度。
  • 在HPatches数据集上,该方法实现了高可重复性与低定位误差,其同调精度与匹配分数指标与最先进基于学习的关键点检测器相当。
  • 定性结果表明,该方法能准确跟踪具有挑战性的序列(如KITTI 03、04、05、07)中的稳定3D关键点,轨迹与真实轨迹高度吻合,漂移极小。
  • 消融研究证实,通过几何监督联合优化关键点与深度网络,相比解耦或非几何正则化训练,可获得显著的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。