[论文解读] Utilizing Semantic Visual Landmarks for Precise Vehicle Navigation
本文提出了一种门控因子图框架,将预训练深度学习模型的语义分割结果整合到基于视觉路标导航的系统中,以过滤掉临时视觉特征(例如车辆、行人)。通过在特征跟踪、地图构建和导航中应用语义感知的特征选择,该方法在3D均方根误差上将无GPS环境下的导航精度提升了21%,展示了在城市环境中具有鲁棒性和泛化能力,且系统修改极少。
This paper presents a new approach for integrating semantic information for vision-based vehicle navigation. Although vision-based vehicle navigation systems using pre-mapped visual landmarks are capable of achieving submeter level accuracy in large-scale urban environment, a typical error source in this type of systems comes from the presence of visual landmarks or features from temporal objects in the environment, such as cars and pedestrians. We propose a gated factor graph framework to use semantic information associated with visual features to make decisions on outlier/ inlier computation from three perspectives: the feature tracking process, the geo-referenced map building process, and the navigation system using pre-mapped landmarks. The class category that the visual feature belongs to is extracted from a pre-trained deep learning network trained for semantic segmentation. The feasibility and generality of our approach is demonstrated by our implementations on top of two vision-based navigation systems. Experimental evaluations validate that the injection of semantic information associated with visual landmarks using our approach achieves substantial improvements in accuracy on GPS-denied navigation solutions for large-scale urban scenarios
研究动机与目标
- 为解决持续存在的挑战:临时视觉特征(例如移动的汽车、行人)导致基于视觉的车辆导航系统精度下降。
- 通过在地图构建过程中过滤语义上瞬态的特征,提升地理参考视觉地图的质量。
- 通过利用语义标签指导路标选择与跟踪,提升无GPS环境下实时导航的精度。
- 开发一种可泛化、即插即用的框架,与现有视觉SLAM和导航系统兼容。
- 证明来自现成深度学习模型的语义信息可显著提升大规模城市环境中导航的鲁棒性与精度。
提出的方法
- 提出一种门控因子图框架,将语义标签整合到视觉导航系统的因子图公式中。
- 从预训练的语义分割网络(例如DeepLab或类似模型)对输入图像应用,提取语义标签。
- 通过门控机制,在特征跟踪和地图构建过程中抑制被标记为“瞬态”的特征(例如车辆、行人)。
- 该框架应用于三个阶段:(1) 实时特征跟踪,(2) 预构建的地理参考地图构建,(3) 使用预构建路标的无GPS导航。
- 系统将每个预构建的路标视为因子图中的单一测量值,利用语义标签对观测值进行加权或拒绝,以基于可靠性进行处理。
- 该方法在两个最先进的系统上进行了评估:ORB-SLAM2(用于提升特征跟踪性能)和一个预构建的视觉-惯性导航系统(用于提升地图与导航性能)。
实验结果
研究问题
- RQ1来自预训练模型的语义分割能否有效降低临时视觉特征对视觉导航精度的影响?
- RQ2语义感知过滤如何提升无GPS城市环境中预构建视觉路标系统的鲁棒性与精度?
- RQ3一种简单、即插即用的语义门控机制在多大程度上能同时提升不同城市场景下的地图质量与导航性能?
- RQ4语义信息的整合是否能在3D轨迹误差指标(如RMS、中位数和第90百分位误差)上带来可测量的改进?
- RQ5所提出的框架能否在不需重大架构修改的前提下,泛化应用于不同视觉导航系统?
主要发现
- 所提方法在测试序列中实现了无GPS导航3D均方根(RMS)误差21%的提升。
- 3D中位数误差降低了19.1%,第90百分位误差改善了22%,表明在复杂条件下具备更强的鲁棒性。
- 所有测试序列中相机标定误差降低了约30厘米,标准差更低,表明在季节变化下具有更高的稳定性与一致性。
- 系统在存在停靠车辆、高速公路和树荫街道的环境中表现出更强的鲁棒性,证实了其在多样化城市场景中的泛化能力。
- 语义选择模块显著提升了地图质量,通过在预映射阶段过滤掉如停靠车辆等瞬态特征。
- 该框架在实时跟踪(如ORB-SLAM2)和预构建导航系统中均表现有效,证明了其通用性与兼容性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。