[论文解读] AVP-SLAM: Semantic Visual Mapping and Localization for Autonomous Vehicles in the Parking Lot
该论文提出AVP-SLAM,一种用于自动驾驶代客泊车的语义视觉SLAM系统,通过从四个环视摄像头和IMU检测到的鲁棒语义特征(如停车线、导引标志和减速带)构建稳定、长期的三维地图。该系统在无GPS、纹理稀疏的停车场中实现了厘米级定位精度,且在长期运行中相较于传统ORB-SLAM2在召回率和地图效率方面表现更优。
Autonomous valet parking is a specific application for autonomous vehicles. In this task, vehicles need to navigate in narrow, crowded and GPS-denied parking lots. Accurate localization ability is of great importance. Traditional visual-based methods suffer from tracking lost due to texture-less regions, repeated structures, and appearance changes. In this paper, we exploit robust semantic features to build the map and localize vehicles in parking lots. Semantic features contain guide signs, parking lines, speed bumps, etc, which typically appear in parking lots. Compared with traditional features, these semantic features are long-term stable and robust to the perspective and illumination change. We adopt four surround-view cameras to increase the perception range. Assisting by an IMU (Inertial Measurement Unit) and wheel encoders, the proposed system generates a global visual semantic map. This map is further used to localize vehicles at the centimeter level. We analyze the accuracy and recall of our system and compare it against other methods in real experiments. Furthermore, we demonstrate the practicability of the proposed system by the autonomous parking application.
研究动机与目标
- 解决在传统视觉SLAM失效的无GPS、纹理稀疏且动态变化的停车场中实现高精度定位的挑战。
- 开发一种基于长期稳定语义特征而非传统几何特征的鲁棒地图构建与定位系统。
- 利用低成本传感器(摄像头、IMU、轮速编码器)实现实际的自动驾驶代客泊车。
- 通过用语义特征替代基于外观的特征,提升地图效率并减少地图尺寸。
提出的方法
- 四台环视摄像头捕获图像,通过逆透视映射(IPM)将图像转换为鸟瞰图。
- 采用深度神经网络在鸟瞰图图像中检测语义特征,如停车线、导引标志和减速带。
- 提取语义特征,并用于构建包含三维位置和描述符的全局视觉语义地图。
- 融合IMU和轮速编码器数据以提升位姿估计精度,减少建图与定位过程中的漂移。
- 通过与预构建地图进行语义特征匹配实现定位,实现厘米级精度的6-DoF位姿估计。
- 采用八叉树结构对地图进行压缩,仅用4.4 MB的空间存储369,356个特征。
实验结果
研究问题
- RQ1在动态停车场环境中,如停车线和导引标志等语义特征是否比传统几何特征更具稳定性和长期可靠性?
- RQ2在环境发生变化的长时间间隔内,所提出的语义SLAM系统在定位召回率和精度方面的表现如何?
- RQ3与传统基于特征的SLAM系统相比,使用语义特征在多大程度上提升了地图效率并减少了地图尺寸?
- RQ4在无GPS条件下,该系统是否能在真实世界自动驾驶代客泊车场景中实现厘米级定位精度?
主要发现
- AVP-SLAM的平均定位误差为2.36 cm,最大误差为5.23 cm,足以实现精确的自动驾驶泊车。
- AVP-SLAM的召回率在一周后保持在78.65%,一个月后为79.23%,而ORB-SLAM2的召回率分别下降至11.42%和10.22%。
- 语义地图大小仅为4.4 MB(八叉树压缩后),尽管特征数量更多,但远小于ORB-SLAM2的33.7 MB。
- AVP-SLAM的建图误差仅为1.33%,表明其在长时间内具有高度的地图准确性和一致性。
- 该系统成功实现了真实世界中的自动驾驶代客泊车,验证了其在动态、无GPS环境下的实用性和鲁棒性。
- 语义特征对光照、视角和外观变化表现出极强的鲁棒性,而传统基于外观的特征则易受其影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。