[论文解读] MID-Fusion: Octree-based Object-Level Multi-Instance Dynamic SLAM
本文提出 MID-Fusion,这是首个利用八叉树结构表示的体素地图,基于 RGB-D 输入构建对象级动态体素地图的 SLAM 系统。通过实例分割、不确定性感知跟踪和概率融合,将多模态数据(颜色、深度、语义)融合到每个对象的模型中,实现了鲁棒的相机跟踪以及对多个运动物体的几何、语义和运动状态的连续估计,在 CPU 上实现 2–3 Hz 的帧率,且重建精度高。
We propose a new multi-instance dynamic RGB-D SLAM system using an object-level octree-based volumetric representation. It can provide robust camera tracking in dynamic environments and at the same time, continuously estimate geometric, semantic, and motion properties for arbitrary objects in the scene. For each incoming frame, we perform instance segmentation to detect objects and refine mask boundaries using geometric and motion information. Meanwhile, we estimate the pose of each existing moving object using an object-oriented tracking method and robustly track the camera pose against the static scene. Based on the estimated camera pose and object poses, we associate segmented masks with existing models and incrementally fuse corresponding colour, depth, semantic, and foreground object probabilities into each object model. In contrast to existing approaches, our system is the first system to generate an object-level dynamic volumetric map from a single RGB-D camera, which can be used directly for robotic tasks. Our method can run at 2-3 Hz on a CPU, excluding the instance segmentation part. We demonstrate its effectiveness by quantitatively and qualitatively testing it on both synthetic and real-world sequences.
研究动机与目标
- 解决静态 SLAM 在动态室内环境中因运动物体导致相机位姿估计被污染的局限性。
- 开发一种多实例动态 SLAM 系统,在保持高精度相机跟踪的同时,将运动物体建模为独立的体素实体。
- 仅使用单个 RGB-D 相机,实现几何、语义和运动属性的高保真、面向对象的重建。
- 通过采用面向对象的八叉树结构体素地图,提升内存效率与地图可用性,以支持机器人应用。
- 通过概率融合,整合并优化语义预测与前景概率,以增强对象模型的质量。
提出的方法
- 系统使用实例分割结合几何与运动线索,实时检测并优化对象掩码。
- 采用面向对象的重参数化跟踪方法,利用测量不确定性对观测值进行加权。
- 相机位姿相对于静态场景模型进行估计,而对象位姿则独立跟踪,以避免漂移。
- 每个检测到的对象均被分配一个基于八叉树的体素模型,该模型逐步融合颜色、深度、语义标签和前景概率。
- 概率融合将语义分布与对象似然性整合到八叉树结构中,实现不确定性感知的模型更新。
- 系统为每个对象维护独立且不发生碰撞的体素地图,从而实现鲁棒的多实例建图。
实验结果
研究问题
- RQ1单个 RGB-D 相机能否生成持久的、面向对象的动态体素地图,以支持在动态室内场景中实现高精度相机跟踪?
- RQ2如何有效融合几何、光度和语义信息,以提升实例分割质量与对象模型精度?
- RQ3以对象为中心的跟踪方法结合不确定性加权,在处理大范围运动时,是否显著优于虚拟相机或标准跟踪方法?
- RQ4基于八叉树的表示能否在动态 SLAM 中同时保持高重建保真度与内存效率?
- RQ5语义与前景概率的整合在多大程度上提升了对象建模的鲁棒性与准确性?
主要发现
- 在使用真实分割结果时,沙发的平均重建误差为 0.46 cm(±0.59),椅子为 0.92 cm(±1.74),表明几何精度极高。
- 即使使用系统自身的分割流水线,重建误差仅轻微增加(沙发为 0.46 cm),表明对分割误差具有强鲁棒性。
- 所提出的面向对象的跟踪方法相比虚拟相机跟踪,将重建误差降低 38%(沙发为 0.74 cm vs. 0.46 cm),尤其在大角度旋转时表现更优。
- 系统在 CPU 上运行速度为 2–3 Hz,平均帧处理时间为 400 ms,且在可见与运动物体数量增加时仍保持高效扩展性。
- 八叉树结构在保持高分辨率重建的同时实现高效的内存使用,其在细节表现与对象分离能力上优于 Co-Fusion 等基于表面元的系统。
- 定性结果表明,系统可成功同时重建超过六个运动物体,对象模型之间无碰撞,且在细节表现上优于当前最先进的基于表面元的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。