[论文解读] Omnidirectional CNN for Visual Place Recognition and Navigation
本文提出了一种全向卷积神经网络(O-CNN),用于在室内环境中使用全向相机进行视觉场景识别与导航。通过引入环形填充、用于实现旋转不变性的滚动分支结构,以及连续提升的结构化特征嵌入损失,O-CNN能够估计与最近场景样本的相对距离,从而实现一种启发式导航策略,在虚拟和真实世界数据集上均实现了最先进水平的准确率与推理速度。
$ $Visual place recognition is challenging, especially when only a few place exemplars are given. To mitigate the challenge, we consider place recognition method using omnidirectional cameras and propose a novel Omnidirectional Convolutional Neural Network (O-CNN) to handle severe camera pose variation. Given a visual input, the task of the O-CNN is not to retrieve the matched place exemplar, but to retrieve the closest place exemplar and estimate the relative distance between the input and the closest place. With the ability to estimate relative distance, a heuristic policy is proposed to navigate a robot to the retrieved closest place. Note that the network is designed to take advantage of the omnidirectional view by incorporating circular padding and rotation invariance. To train a powerful O-CNN, we build a virtual world for training on a large scale. We also propose a continuous lifted structured feature embedding loss to learn the concept of distance efficiently. Finally, our experimental results confirm that our method achieves state-of-the-art accuracy and speed with both the virtual world and real-world datasets.
研究动机与目标
- 解决在仅有少量场景样本可用的情况下,室内环境中的视觉场景识别与导航问题。
- 提升在真实世界机器人导航中常见的大范围相机位姿变化下的鲁棒性。
- 开发一种深度学习模型,用于估计视觉输入与场景样本之间的相对距离,以实现高效导航。
- 构建一个可扩展的、无需标注的虚拟世界,用于训练和评估视觉场景识别模型。
提出的方法
- O-CNN在输入空间和特征空间中均使用环形填充,以处理全向图像的拓扑特性,避免边界效应。
- 引入滚动分支机制,通过处理旋转后的特征图并聚合预测结果,实现旋转不变性。
- 提出一种连续提升的结构化特征嵌入损失,将相对距离信息嵌入特征空间,从而支持距离估计。
- 在大规模合成的室内虚拟世界中端到端训练模型,以实现高效、安全且可扩展的训练。
- 采用启发式导航策略,利用估计的相对距离引导机器人向最近的场景样本移动。
- 在虚拟和真实世界数据集上对系统进行评估,并通过从虚拟环境到真实环境的迁移学习验证泛化能力。
实验结果
研究问题
- RQ1深度学习模型能否在相机位姿高度变化的情况下,有效估计视觉输入与场景样本之间的相对距离?
- RQ2引入环形填充与旋转不变性机制在全向视觉场景识别中如何提升性能?
- RQ3连续提升的结构化特征嵌入在视觉场景识别中对距离感知表征学习的增强程度如何?
- RQ4在合成虚拟世界中预训练的模型能否有效泛化到真实世界的室内导航任务?
- RQ5在样本数量有限的情况下,所提出的O-CNN与最先进方法相比,在准确率、速度和鲁棒性方面表现如何?
主要发现
- 在虚拟世界中,O-CNN在所有误差容忍度下的平均召回率达到69.7%,优于NetVLAD(62.0%)、Disloc(43.8%)和PoseNet(2.7%)。
- 在虚拟世界中,O-CNN的单次查询推理时间为128.21毫秒,显著快于Disloc的2439.02毫秒。
- 在真实世界数据集中,O-CNN在所有误差容忍度下的平均召回率为77.1%,优于Disloc的65.4%。
- 在召回-距离评估中,O-CNN在2米以内的距离内保持更优性能,平均召回率为57.2%,高于Disloc的51.5%。
- 消融实验表明,环形填充、滚动分支和连续提升嵌入三个组件均对性能有显著贡献,其中O-CNN CLCR取得最佳结果。
- 在局部导航任务中,O-CNN以平均22.01步实现84%的成功率,优于NetVLAD的68%成功率和36.14步的平均步数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。