Skip to main content
QUICK REVIEW

[论文解读] Semantic Nearest Neighbor Fields Monocular Edge Visual-Odometry

Xiaolong Wu, Assia Benbihi|arXiv (Cornell University)|Apr 1, 2019
Robotics and Sensor-Based Localization参考文献 34被引用 6
一句话总结

本文提出了一种单目视觉里程计系统,利用深度学习的语义边缘和一种新型语义最近邻场(SNNF),在户外环境中实现鲁棒且精确的相机运动估计。通过将语义感知的数据关联整合到基于ICP的边缘匹配框架中,该方法显著提升了收敛半径和跟踪鲁棒性,在KITTI基准测试中,尤其在城市和高速公路场景下,优于最先进的直接法、间接法和语义视觉里程计系统。

ABSTRACT

Recent advances in deep learning for edge detection and segmentation opens up a new path for semantic-edge-based ego-motion estimation. In this work, we propose a robust monocular visual odometry (VO) framework using category-aware semantic edges. It can reconstruct large-scale semantic maps in challenging outdoor environments. The core of our approach is a semantic nearest neighbor field that facilitates a robust data association of edges across frames using semantics. This significantly enlarges the convergence radius during tracking phases. The proposed edge registration method can be easily integrated into direct VO frameworks to estimate photometrically, geometrically, and semantically consistent camera motions. Different types of edges are evaluated and extensive experiments demonstrate that our proposed system outperforms state-of-art indirect, direct, and semantic monocular VO systems.

研究动机与目标

  • 解决户外单目视觉里程计中收敛半径有限和边缘重复性差的问题。
  • 通过利用语义信息改进基于边缘的视觉里程计中的数据关联,实现更鲁棒的跟踪。
  • 评估不同边缘检测方法(尤其是深度神经网络学习的边缘与传统Canny边缘)对真实户外环境中自运动估计的影响。
  • 开发一种能够重建大规模、在光照、几何和语义上一致的3D语义边缘图的系统。
  • 在城市和高速公路等具有挑战性的户外环境中,证明其性能优于最先进的单目视觉里程计系统。

提出的方法

  • 系统使用深度神经网络(CaseNet)从单目图像中生成类别感知的语义边缘,提升户外条件下边缘的重复性。
  • 提出语义最近邻场(SNNF),通过语义标签引导最近邻匹配,实现在帧间边缘之间的鲁棒数据关联。
  • SNNF框架与基于直接ICP的边缘匹配方法集成,实现在运动估计中同时保持光照、几何和语义一致性。
  • 采用灵活的采样策略,将未标注像素纳入优化过程,从而在边缘稀疏、植被主导的区域中稳定运动估计。
  • 将该方法集成到直接视觉里程计框架中,在最小化光照误差的同时,通过统一的能量函数施加几何和语义约束。
  • 使用KITTI序列对系统进行评估,与ORBSLAM2、DSO和VSO进行比较,以轨迹精度和运行时间作为关键指标。

实验结果

研究问题

  • RQ1通过SNNF实现的语义感知数据关联,在户外环境中如何提升基于边缘的视觉里程计的收敛半径和鲁棒性?
  • RQ2不同边缘检测方法(尤其是深度网络学习的边缘与传统Canny边缘)对自运动估计精度的相对影响是什么?
  • RQ3与非城市、植被主导的环境相比,语义约束在城市和高速公路场景中在多大程度上提升了跟踪性能?
  • RQ4结合语义边缘的直接视觉里程计框架是否能实现优于最先进的间接和直接视觉里程计系统的精度和鲁棒性?
  • RQ5语义边缘的集成对大规模户外地图构建中的运行时间和实时可行性产生何种影响?

主要发现

  • 在KITTI序列00、02、08和09上,该方法实现了最低的轨迹误差,其中序列00的误差为11.82%,优于ORBSLAM2(16.14%)和DSO(16.83%)。
  • 在高速公路序列(如00、02、09)中,系统成功恢复了完整轨迹,而其他方法失败,表明其具有更优的收敛鲁棒性。
  • 使用端到端学习的边缘相比融合边缘表示,能获得更高的跟踪精度,表明边缘学习更具稳定性。
  • 语义约束在城市和高速公路场景中显著提升了性能,但在村庄序列中增益有限,原因在于边缘密度低且语义模糊。
  • 系统在NVIDIA GTX 1080Ti上处理每张图像约需0.7秒,接近在线处理,由于语义边缘计算和SNNF处理,处理时间相比DSO增加了1.34倍。
  • 消融实验表明,基于边缘的视觉里程计在边缘丰富且语义元素分布均匀的环境中受益最大,而在边缘稀疏、植被茂密的场景中性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。