[论文解读] Self-Supervised Visual Place Recognition Learning in Mobile Robots
本文提出了一种用于移动机器人视觉场景识别的自监督度量学习方法,利用GPS辅助导航生成正负图像对以训练孪生网络。该方法学习一个校准的嵌入空间,使相似场景的图像紧密聚集,显著提升了回环检测性能,并实现了视觉SLAM系统中鲁棒、无漂移的轨迹估计。
Place recognition is a critical component in robot navigation that enables it to re-establish previously visited locations, and simultaneously use this information to correct the drift incurred in its dead-reckoned estimate. In this work, we develop a self-supervised approach to place recognition in robots. The task of visual loop-closure identification is cast as a metric learning problem, where the labels for positive and negative examples of loop-closures can be bootstrapped using a GPS-aided navigation solution that the robot already uses. By leveraging the synchronization between sensors, we show that we are able to learn an appropriate distance metric for arbitrary real-valued image descriptors (including state-of-the-art CNN models), that is specifically geared for visual place recognition in mobile robots. Furthermore, we show that the newly learned embedding can be particularly powerful in disambiguating visual scenes for the task of vision-based loop-closure identification in mobile robots.
研究动机与目标
- 解决手工设计描述符和固定距离度量在视觉场景识别中的局限性。
- 使移动机器人能够以自监督方式从经验中学习并适应其视觉表征。
- 通过学习环境特定的度量,提升对外观变化(如天气、光照)的鲁棒性。
- 开发一种方法,利用真实世界机器人经验微调预训练卷积神经网络,无需人工标注。
- 通过生成准确且校准的回环约束,提升视觉SLAM性能。
提出的方法
- 该方法使用共享权重的孪生神经网络,学习图像对的度量嵌入空间。
- 正负图像对通过GPS辅助导航数据自动生成,利用时间与空间同步性。
- 模型采用对比损失进行训练,结合距离加权采样策略,优先选择更具挑战性的负样本。
- 采样阈值 τ^Rt = 0.9 确保仅视场重叠显著的图像对被视为潜在正样本。
- 仅对预训练的Places205 AlexNet的最后全连接层(fc6, fc7)进行微调,早期层保持冻结。
- 回环约束作为姿态图中的弱零旋转与平移相对位姿约束引入,协方差设为3m和0.3rad。
实验结果
研究问题
- RQ1自监督度量学习框架是否能通过利用GPS辅助同步提升视觉场景识别性能?
- RQ2所学习的嵌入空间是否能比标准CNN描述符更好地区分视觉上相似的场景?
- RQ3该方法是否能有效实现预训练模型在真实机器人运行环境中的微调?
- RQ4所学习的度量是否能提升在里程计漂移下长期轨迹的准确性?
- RQ5该系统在未参与训练的新会话中泛化能力如何?
主要发现
- 所提方法通过学习一个校准良好的嵌入空间,显著提升了回环检测的准确性,有效减少了正负样本之间的重叠。
- 所学习的度量在多种环境中表现出鲁棒性能,包括KITTI和St. Lucia数据集,在里程计漂移下均能实现一致的轨迹恢复。
- 使用所学习的回环约束进行姿态图优化,可生成无漂移、高精度的轨迹,如图9所示,适用于KITTI Sequence 00和St. Lucia数据。
- 模型在未参与训练的新会话中表现出良好的泛化能力,展示了其在未见环境中的可迁移性与适应性。
- 使用10倍数量的负样本并引入类别加权,稳定了训练过程并提升了度量的泛化能力。
- 该方法仅通过自监督、GPS辅助的监督信号,成功实现了对预训练CNN(Places205 AlexNet)的有效微调,无需人工标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。