[论文解读] Movable-Object-Aware Visual SLAM via Weakly Supervised Semantic Segmentation
本论文提出了一种弱监督语义分割方法,用于在动态环境中检测可移动物体,使视觉SLAM系统能够避免将移动物体用作特征点。通过利用图像级别标签和条件随机场(CRF)进行弱监督训练,该方法在TUM RGB-D和KITTI数据集上实现了最先进性能,且无需昂贵的像素级标注。
Moving objects can greatly jeopardize the performance of a visual simultaneous localization and mapping (vSLAM) system which relies on the static-world assumption. Motion removal have seen successful on solving this problem. Two main streams of solutions are based on either geometry constraints or deep semantic segmentation neural network. The former rely on static majority assumption, and the latter require labor-intensive pixel-wise annotations. In this paper we propose to adopt a novel weakly-supervised semantic segmentation method. The segmentation mask is obtained from a CNN pre-trained with image-level class labels only. Thus, we leverage the power of deep semantic segmentation CNNs, while avoid requiring expensive annotations for training. We integrate our motion removal approach with the ORB-SLAM2 system. Experimental results on the TUM RGB-D and the KITTI stereo datasets demonstrate our superiority over the state-of-the-art.
研究动机与目标
- 解决动态环境中移动物体导致视觉SLAM性能下降的问题。
- 克服传统运动去除方法依赖静态主导假设或需要昂贵像素级标注的局限性。
- 开发一种基于深度学习、最小监督的实用且可适应的动态环境SLAM解决方案。
- 将弱监督语义分割集成到ORB-SLAM2中,防止特征点被分配到可移动物体上。
- 在城市驾驶和室内导航等真实场景中,提升长期数据关联性和系统鲁棒性。
提出的方法
- 利用仅带有图像级别类别标签的预训练深度卷积神经网络(CNN)进行弱监督语义分割。
- 应用条件随机场(CRF)将粗粒度分割输出优化为密集像素级掩码。
- 构建二值掩码,识别属于预定义可移动物体类别(如汽车、行人)的所有像素。
- 将二值掩码集成到ORB-SLAM2的跟踪模块中,抑制可移动物体区域内的特征点分配。
- 在可用时将深度信息融入CRF优化过程,提升掩码精度。
- 通过仅修改前端特征管理逻辑,保持与标准ORB-SLAM2的兼容性。
实验结果
研究问题
- RQ1弱监督语义分割能否在无需像素级标注的情况下,有效检测动态场景中的可移动物体?
- RQ2弱监督分割的集成在多大程度上提升了ORB-SLAM2在动态环境中的鲁棒性?
- RQ3在CRF优化过程中引入深度信息在多大程度上提升了面向运动感知SLAM的分割精度?
- RQ4所提方法在基准数据集上的定位精度和鲁棒性方面是否优于现有最先进方法?
- RQ5在可移动物体密度较高的场景中,该方法能否在保持短期跟踪和长期回环检测精度的同时维持性能?
主要发现
- 在TUM RGB-D数据集中,与ORB-SLAM2相比,本方法在序列06的平移RPE RMSE上实现了31.01%的提升。
- 在KITTI双目数据集上,本方法在序列09的绝对轨迹误差(ATE)上实现了49.17%的改进,显著优于基线方法。
- 在KITTI数据集的10个序列中,有6个序列达到了最先进性能,尤其在序列06、07和09中表现突出。
- 在CRF优化中使用深度信息显著提升了分割质量,从而带来了更优的运动感知SLAM性能。
- 尽管存在大量动态物体,系统在长期回环检测中仍保持鲁棒性,显著减少了数据关联中的误匹配。
- 语义分割的平均推理时间为每张图像1.27秒,表明其在中等速度应用中具备实时部署的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。