Skip to main content
QUICK REVIEW

[论文解读] Learning Whole-Image Descriptors for Real-time Loop Detection andKidnap Recovery under Large Viewpoint Difference

Manohar Kuse, Shaojie Shen|arXiv (Cornell University)|Apr 15, 2019
Robotics and Sensor-Based Localization参考文献 63被引用 7
一句话总结

本文提出了一种实时立体视觉-惯性SLAM系统,采用基于解耦卷积的轻量化全图描述符,并结合一种新颖的全对损失函数,实现了在大视角差异下的鲁棒回环检测与绑架恢复。该方法在保持高召回率的同时,相比标准NetVLAD,推理速度提升3倍,参数量减少10倍,尤其在具有平面内旋转和视角变化的挑战性序列中表现优异。

ABSTRACT

We present a real-time stereo visual-inertial-SLAM system which is able to recover from complicatedkidnap scenarios and failures online in realtime. We propose to learn the whole-image-descriptorin a weakly supervised manner based on NetVLAD and decoupled convolutions. We analyse thetraining difficulties in using standard loss formulations and propose an allpairloss and show itseffect through extensive experiments. Compared to standard NetVLAD, our network takes an orderof magnitude fewer computations and model parameters, as a result runs about three times faster.We evaluate the representation power of our descriptor on standard datasets with precision-recall.Unlike previous loop detection methods which have been evaluated only on fronto-parallel revisits,we evaluate the performace of our method with competing methods on scenarios involving largeviewpoint difference. Finally, we present the fully functional system with relative computation andhandling of multiple world co-ordinate system which is able to reduce odometry drift, recover fromcomplicated kidnap scenarios and random odometry failures. We open source our fully functional system as an add-on for the popular VINS-Fusion.

研究动机与目标

  • 解决在大视角差异下传统方法失效的视觉SLAM系统中回环检测与绑架恢复的挑战。
  • 开发一种实时、高效且鲁棒的视觉场景识别系统,能够泛化于视角、光照和纹理变化。
  • 通过引入一种新颖的全对损失函数,克服NetVLAD使用三元组损失训练时的不稳定性。
  • 实现在线、实时地合并多个坐标系,以支持对长距离链式绑架事件的恢复。
  • 构建一个可部署、可插拔的模块,集成至VINS-Fusion中,以减少漂移并提升故障恢复能力。

提出的方法

  • 利用弱监督学习框架,在NetVLAD中引入解耦卷积,以减小模型大小并降低计算时间。
  • 提出一种全对损失函数,以提升训练稳定性与性能,尤其在聚类数较少时,优于标准三元组损失。
  • 设计一种系统架构,可同时维护多个世界坐标系,并在回环检测时计算其间的相对位姿。
  • 将描述符作为实时模块集成至VINS-Fusion中,实现实时检测与绑架场景下的恢复。
  • 利用位姿图优化器,基于跨世界回环候选点,合并不同世界坐标系下的轨迹。
  • 在自采集序列和标准数据集上进行训练,仅需极少人工标注,依赖时间邻近性作为弱监督信号。

实验结果

研究问题

  • RQ1在弱监督下训练的全图描述符是否能在大视角差异和平面内旋转下实现鲁棒的回环检测?
  • RQ2在聚类数有限的情况下,所提出的全对损失相比三元组损失在NetVLAD中是否能提升训练稳定性和性能?
  • RQ3基于轻量化解耦卷积的网络在多大程度上可降低计算成本,同时保持场景识别的准确性?
  • RQ4系统是否能通过多坐标系机制实现实时检测并恢复长距离、链式绑架场景?
  • RQ5在真实世界序列中,该方法与最先进的BOVW和CNN方法相比,在精度、召回率和推理速度方面表现如何?

主要发现

  • 所提出的全对损失显著提升了训练稳定性和性能,尤其在聚类数较少时,相比三元组损失在召回率和收敛性方面表现更优。
  • 由于采用了解耦卷积,系统推理速度约为标准NetVLAD的3倍,且可学习参数量减少5–7倍。
  • 在具有大视角差异和平面内旋转的序列中,该方法的召回率显著高于DBOW2及其他基于BOVW的方法。
  • 系统可实现实时检测并成功恢复多个绑架场景,如图1所示,支持不同坐标系间轨迹的实时融合。
  • 该描述符对光照变化、低纹理和视角变化具有强鲁棒性,在标准数据集和自采集的挑战性数据集上均表现出优异的泛化能力。
  • 作为VINS-Fusion插件的开源实现,支持实时部署,并为长期自主与语义SLAM的后续研究提供了便利。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。