Skip to main content
QUICK REVIEW

[论文解读] RGB-D-Inertial SLAM in Indoor Dynamic Environments with Long-term Large Occlusion

Ran Long, Christian Rauch|arXiv (Cornell University)|Mar 23, 2023
Robotics and Sensor-Based Localization被引用 4
一句话总结

该论文提出了一种鲁棒的RGB-D-惯性SLAM系统,能够同时追踪相机、对动态物体进行聚类式密集分割,并利用融合的稀疏与密集特征维持稀疏静态地图。在长时间大范围遮挡场景下,该方法在定位、动态物体分割和背景重建方面均优于当前最先进方法。

ABSTRACT

This work presents a novel RGB-D-inertial dynamic SLAM method that can enable accurate localisation when the majority of the camera view is occluded by multiple dynamic objects over a long period of time. Most dynamic SLAM approaches either remove dynamic objects as outliers when they account for a minor proportion of the visual input, or detect dynamic objects using semantic segmentation before camera tracking. Therefore, dynamic objects that cause large occlusions are difficult to detect without prior information. The remaining visual information from the static background is also not enough to support localisation when large occlusion lasts for a long period. To overcome these problems, our framework presents a robust visual-inertial bundle adjustment that simultaneously tracks camera, estimates cluster-wise dense segmentation of dynamic objects and maintains a static sparse map by combining dense and sparse features. The experiment results demonstrate that our method achieves promising localisation and object segmentation performance compared to other state-of-the-art methods in the scenario of long-term large occlusion.

研究动机与目标

  • 解决在长时间内多数相机视图被多个动态物体遮挡时的精确相机定位挑战。
  • 克服现有动态SLAM方法在动态物体主导场景中失效的问题,尤其当无法通过语义分割或异常值剔除检测动态物体时。
  • 通过将IMU的运动先验与紧耦合的bundle adjustment联合优化,实现鲁棒的视觉-惯性SLAM,同时估计相机位姿、动态物体分割与静态地图重建。
  • 通过主动移除动态区域的地图点并结合稀疏与密集特征维持稀疏静态地图,提升长期鲁棒性。
  • 在完整序列处理后,利用估计的相机轨迹与动态物体分割结果,实现精确的密集背景重建。

提出的方法

  • 提出一种紧耦合的视觉-惯性bundle adjustment,联合优化相机位姿、IMU偏差、密集动态物体分割与稀疏静态地图点。
  • 融合关键帧中的稀疏特征与RGB-D输入的密集特征,提升在长时间大范围遮挡下的鲁棒性。
  • 利用IMU提供的运动先验,提升在静态背景特征稀缺时对造成大范围遮挡的动态物体的检测能力。
  • 采用聚类式密集分割方法,随时间推移识别并分离多个动态物体与静态背景。
  • 通过主动移除与动态区域关联的地图点,维持稀疏静态地图,确保在长时间遮挡期间地图的一致性。
  • 在后处理阶段,利用估计的相机轨迹与密集分割结果进行密集背景重建,实现精确的静态场景建模。

实验结果

研究问题

  • RQ1当相机视图在长时间内被动态物体大面积遮挡时,视觉-惯性SLAM系统能否维持精确的相机定位?
  • RQ2在缺乏先验语义知识或主导静态背景特征的情况下,如何有效检测并分割动态物体?
  • RQ3与现有方法相比,结合稀疏与密集特征在长时间大范围遮挡场景下的鲁棒性提升程度如何?
  • RQ4在严重遮挡条件下,紧耦合的bundle adjustment框架能否同时估计相机运动、动态物体分割与静态地图重建?
  • RQ5在定位精度、动态分割与背景重建方面,该方法与当前最先进SLAM系统相比性能如何?

主要发现

  • 在长时间大范围遮挡序列(LTLO)中,该方法在定位精度方面优于当前最先进方法,尤其在持续遮挡超过40秒的序列中表现更优。
  • 在动态物体分割方面,仅本方法在LTLO序列(seq7)的所有帧中均提供了稳定且准确的聚类式密集分割;而SF、CF与PF则失败或产生不一致结果。
  • 在背景重建方面,该方法优于StaticFusion(SF)与Co-Fusion(CF):SF错误地将动态物体映射到静态模型中,而CF则产生不完整的分割。
  • PlanarFusion(PF)的分割效果优于SF与CF,但在动态物体移除后无法维持一致的定位,导致重建中静态物体错位。
  • 消融实验表明,关闭回环检测线程会降低定位精度,表明动态物体移除显著提升了长时间遮挡下的鲁棒性。
  • 利用估计轨迹与分割结果进行的密集背景重建与真实值高度吻合,证明了后处理重建流程的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。