[论文解读] DytanVO: Joint Refinement of Visual Odometry and Motion Segmentation in Dynamic Environments
DytanVO 是一种基于监督学习的视觉里程计系统,通过迭代优化光流、位姿和动态物体掩码,在动态环境中联合优化相机自运动和运动分割。在真实世界的动态数据集上,其 ATE 相较于最先进视觉里程计方法平均提升 27.7%,性能优于未经微调的后端优化 SLAM 系统。
Learning-based visual odometry (VO) algorithms achieve remarkable performance on common static scenes, benefiting from high-capacity models and massive annotated data, but tend to fail in dynamic, populated environments. Semantic segmentation is largely used to discard dynamic associations before estimating camera motions but at the cost of discarding static features and is hard to scale up to unseen categories. In this paper, we leverage the mutual dependence between camera ego-motion and motion segmentation and show that both can be jointly refined in a single learning-based framework. In particular, we present DytanVO, the first supervised learning-based VO method that deals with dynamic environments. It takes two consecutive monocular frames in real-time and predicts camera ego-motion in an iterative fashion. Our method achieves an average improvement of 27.7% in ATE over state-of-the-art VO solutions in real-world dynamic environments, and even performs competitively among dynamic visual SLAM systems which optimize the trajectory on the backend. Experiments on plentiful unseen environments also demonstrate our method's generalizability.
研究动机与目标
- 解决基于学习的视觉里程计在动态环境中因运动物体干扰而导致自运动估计受限的问题。
- 克服依赖语义分割来移除动态物体的局限性,该方法在未见类别上失效,并且容易将静态物体与可移动物体混淆。
- 通过在监督框架中联合优化,利用自运动估计与运动分割之间的相互依赖关系。
- 开发一种实时、端到端可训练的系统,在无需后端轨迹优化的情况下提升高度动态场景下的鲁棒性。
- 展示在未见环境中的泛化能力,以及在剧烈相机运动和高动态物体密度下的鲁棒性。
提出的方法
- 该框架采用三阶段架构:匹配网络用于初始光流估计,位姿网络用于自运动预测,运动分割网络用于动态区域分类。
- 在每次迭代优化步骤中,将掩码内的动态区域光流设为零,以隔离运动影响。
- 位姿网络与分割网络通过多轮迭代逐步优化,而匹配网络仅运行一次以保持实时性能。
- 系统使用合成数据进行监督训练,从而在无需微调的情况下泛化到真实世界的动态场景。
- 迭代优化使自运动与运动分割在实时约束下能够快速收敛。
- 动态物体掩码基于自运动补偿后的残差光流进行更新,从而在迭代过程中逐步提升分割精度。
实验结果
研究问题
- RQ1联合优化自运动与运动分割是否能提升动态视觉里程计的性能?
- RQ2监督学习方法是否在泛化到未见动态环境方面优于自监督或无监督方法?
- RQ3位姿与分割的迭代优化是否足够快,可满足实时部署需求?
- RQ4与最先进视觉里程计和 SLAM 系统相比,该方法在高度动态场景中的表现如何?
- RQ5当动态物体主导场景或相机运动极小时,系统的失效模式是什么?
主要发现
- 在 KITTI 视觉里程计数据集上,DytanVO 相较于第二好的视觉里程计方法,ATE 平均提升 27.7%,且未在 KITTI 上进行任何微调。
- 在 AirDOS-Shibuya 数据集上,DytanVO 是唯一在 RoadCrossing VI 和 VII 等高度动态序列中仍能保持跟踪的基于学习的视觉里程计,所有基线方法均失败。
- 在具有剧烈相机运动和大尺寸动态物体的序列中,DytanVO 的 ATE 相较于 AirDOS、VDO-SLAM 和 DynaSLAM 等动态 SLAM 系统提升超过 80%。
- 在包含快速移动车辆或大尺寸动态物体的序列中(如 KITTI 的序列 10),DytanVO 是唯一能保持跟踪的视觉里程计,表现稳健。
- 尽管未使用轨迹优化,DytanVO 的性能仍可与 DROID-SLAM(后端优化的 SLAM 系统)相媲美。
- 当所有前景物体均在运动且背景无纹理时,系统会失效,因为光流被完全掩码,导致估计发散。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。