Skip to main content
QUICK REVIEW

[论文解读] Fusion++: Volumetric Object-Level SLAM

John McCormac, Ronald Clark|arXiv (Cornell University)|Aug 25, 2018
Robotics and Sensor-Based Localization参考文献 38被引用 15
一句话总结

Fusion++ 提出了一种在线的、基于物体的 SLAM 系统,通过使用尺寸自适应分辨率的每物体截断符号距离函数(TSDF)和 3D 前景掩码,构建持久且全局一致的 3D 地图。它通过维护物体实例的位姿图,实现无需物体内部形变的回环检测,从而在复杂室内场景中实现实时性能(4–8 Hz),并展现出高重建质量与内存效率。

ABSTRACT

We propose an online object-level SLAM system which builds a persistent and accurate 3D graph map of arbitrary reconstructed objects. As an RGB-D camera browses a cluttered indoor scene, Mask-RCNN instance segmentations are used to initialise compact per-object Truncated Signed Distance Function (TSDF) reconstructions with object size-dependent resolutions and a novel 3D foreground mask. Reconstructed objects are stored in an optimisable 6DoF pose graph which is our only persistent map representation. Objects are incrementally refined via depth fusion, and are used for tracking, relocalisation and loop closure detection. Loop closures cause adjustments in the relative pose estimates of object instances, but no intra-object warping. Each object also carries semantic information which is refined over time and an existence probability to account for spurious instance predictions. We demonstrate our approach on a hand-held RGB-D sequence from a cluttered office scene with a large number and variety of object instances, highlighting how the system closes loops and makes good use of existing objects on repeated loops. We quantitatively evaluate the trajectory error of our system against a baseline approach on the RGB-D SLAM benchmark, and qualitatively compare reconstruction quality of discovered objects on the YCB video dataset. Performance evaluation shows our approach is highly memory efficient and runs online at 4-8Hz (excluding relocalisation) despite not being optimised at the software level.

研究动机与目标

  • 开发一种在线的、持久的 3D SLAM 系统,专注于重建和跟踪单个物体,而非密集场景几何结构。
  • 解决在复杂室内场景中保持对任意、先前未知物体实例的高精度、全局一致 3D 重建的挑战。
  • 通过使用按尺寸自适应分辨率的紧凑型每物体 TSDF 体素,而非单一的大规模 TSDF 体素,提升内存效率与可扩展性。
  • 通过物体实例的位姿图实现鲁棒的跟踪、重定位与回环检测,避免物体内部形变。

提出的方法

  • 使用 Mask R-CNN 实现实时光影实例分割,以基于物体尺寸自适应分辨率初始化每物体 TSDF 重建。
  • 应用一种新颖的 3D 体素掩码,仅将检测到的实例前景融合进 TSDF,提升重建保真度并减少背景融合带来的噪声。
  • 维护一个持久的 6DoF 物体实例位姿图作为唯一地图表示,通过回环检测实现全局一致性。
  • 通过 TSDF 融合逐帧集成深度数据,随时间推移细化物体几何结构,同时保留语义标签和存在概率。
  • 使用独立的临时局部 TSDF 进行跟踪与遮挡建模,将其与持久的物体地图解耦。
  • 为每个物体引入存在概率以处理误检,并通过删除机制随时间管理误报。

实验结果

研究问题

  • RQ1SLAM 系统能否仅使用 RGB-D 输入,在复杂室内环境中维持对任意未知物体实例的高保真、语义标注 3D 重建?
  • RQ2基于物体的 SLAM 如何在不形变单个物体重建的前提下实现全局一致性和回环检测?
  • RQ3与单一密集 TSDF 相比,使用每物体可变分辨率 TSDF 时,内存效率与重建质量之间的权衡如何?
  • RQ4系统如何在长时间序列中处理检测错误与误报的实例预测?
  • RQ5随着物体实例数量的增加,系统在运行时间和内存使用方面是否具备良好的可扩展性?

主要发现

  • 在包含 105 个物体的复杂办公室序列中,Fusion++ 实现了 4–8 Hz 的帧率(不包括重定位与图优化),证明了其实时可行性。
  • 在 RGB-D SLAM 基准测试中,与基线 TSDF 里程计相比,Fusion++ 在 fr2_desk 序列上的绝对轨迹误差(ATE RMSE)降低了高达 66%(从 0.342 m 降至 0.114 m)。
  • 系统仅使用 377 MB GPU 内存存储 105 个物体,平均每个物体约 4 MB,得益于每物体、尺寸自适应的 TSDF,展现出极高的内存效率。
  • 物体重建在定性上优于基线方法,前景细节清晰保留,位姿图中的漂移极小。
  • 位姿图优化成功实现回环检测,调整了物体实例之间的相对位姿,而未对单个物体几何结构造成形变。
  • 系统在物体数量增加时表现出良好扩展性,平均每个可见物体仅增加约 1ms 的计算时间,运行时间组件呈线性增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。