[论文解读] D$^3$FlowSLAM: Self-Supervised Dynamic SLAM with Flow Motion Decomposition and DINO Guidance
本文提出 DeFlowSLAM,一种自监督动态 SLAM 系统,通过双流表示将光流分解为静态(相机运动)和动态(物体运动)分量。通过利用带有掩码聚合(Mask-Agg)的动态更新模块实现遮挡感知的图像扭曲,并结合自监督优化,DeFlowSLAM 在高度动态场景中性能优于 DROID-SLAM,同时在静态环境中仍保持优异的精度。
In this paper, we introduce a self-supervised deep SLAM method that robustly operates in dynamic scenes while accurately identifying dynamic components. Our method leverages a dual-flow representation for static flow and dynamic flow, facilitating effective scene decomposition in dynamic environments. We propose a dynamic update module based on this representation and develop a dense SLAM system that excels in dynamic scenarios. In addition, we design a self-supervised training scheme using DINO as a prior, enabling label-free training. Our method achieves superior accuracy compared to other self-supervised methods. It also matches or even surpasses the performance of existing supervised methods in some cases. All code and data will be made publicly available upon acceptance.
研究动机与目标
- 解决单目稠密 SLAM 中动态物体干扰的问题,该问题会降低位姿估计与地图构建的精度。
- 克服现有 SLAM 系统仅丢弃动态像素或依赖重型检测模型(如 Mask R-CNN)的局限性。
- 开发一种自监督学习框架,用于训练动态 SLAM 系统,无需位姿、深度或光流的真值监督。
- 通过显式分离建模静态与动态运动分量,实现在动态场景中鲁棒的相机位姿与深度估计。
- 在静态与高度动态环境中均实现高性能,包括存在移动物体的真实世界 AR 应用。
提出的方法
- 提出双流表示,将光流分解为静态光流场(由相机运动引起)与动态光流场(由物体运动引起),模拟人类视觉感知。
- 通过从当前帧到相邻帧的图像扭曲来估计静态与动态光流场,总光流为两者之和。
- 设计动态更新模块,引入 Mask-Agg 算子,利用 ConvGRU 迭代优化动态掩码,减少因遮挡导致的错误对齐。
- 将优化后的动态掩码与估计权重整合至稠密捆绑调整(DBA)层中,以自监督方式联合优化相机位姿、逆深度与光流残差。
- 利用 DINO 特征提升自监督训练目标中的特征匹配与一致性。
- 采用光度一致性损失,端到端自监督训练整个系统,无需真值标签。
实验结果
研究问题
- RQ1与标准光流估计相比,双流光流表示是否能提升 SLAM 在动态场景中的鲁棒性?
- RQ2在缺乏真值监督的情况下,自监督训练范式对动态稠密 SLAM 的有效性如何?
- RQ3动态运动分解与遮挡感知掩码优化是否能减少漂移并提升高度动态环境中的位姿精度?
- RQ4与最先进 SLAM 系统相比,DeFlowSLAM 在静态、动态及具有挑战性的 AR 场景中泛化能力如何?
- RQ5双流表示是否可在无需额外训练的情况下有效用于运动分割?
主要发现
- 在 EuRoC 数据集的单目设置下,DeFlowSLAM 的平均 ATE 为 0.136m,优于大多数有监督方法,展现出强大的泛化能力。
- 在 TUM-RGBD 静态序列上,DeFlowSLAM 的平均 ATE 为 0.114m,优于最先进方法 DROID-SLAM。
- 在高度动态的 KITTI 序列 09 中,DeFlowSLAM 显著优于 DROID-SLAM,后者表现出严重漂移,证实了其在动态环境中的鲁棒性。
- 在 Virtual KITTI2 数据集上,DeFlowSLAM 的运动分割 mIoU 分数达到 0.538585(VK01)、0.528356(VK02)和最高 0.739282(VK18),展现出强大的运动分割能力。
- 在双目 SLAM 中,DeFlowSLAM 在 TartanAir 双目测试集上的平均 ATE 为 1.02m,优于 TartanVO,并与 DROID-SLAM 性能相当。
- 在 AR 应用中,DeFlowSLAM 在存在动态干扰物的情况下仍能稳定跟踪相机并渲染虚拟物体,而 DROID-SLAM 则出现显著漂移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。