[论文解读] Dynamic Objects Segmentation for Visual Localization in Urban Environments
本文提出一种基于CNN的半监督方法,利用合成(CARLA)和真实世界RGB数据的组合,实现实时动态物体在城市场景中的实例分割。该模型以Mask R-CNN为主干网络端到端训练,在Cityscapes数据集上达到最先进性能,其中仅使用真实数据微调的变体(m_real)显著优于仅使用合成数据的模型,证明了其在未见城市环境中强大的泛化能力,且无需事先提供语义类别标签。
Visual localization and mapping is a crucial capability to address many challenges in mobile robotics. It constitutes a robust, accurate and cost-effective approach for local and global pose estimation within prior maps. Yet, in highly dynamic environments, like crowded city streets, problems arise as major parts of the image can be covered by dynamic objects. Consequently, visual odometry pipelines often diverge and the localization systems malfunction as detected features are not consistent with the precomputed 3D model. In this work, we present an approach to automatically detect dynamic object instances to improve the robustness of vision-based localization and mapping in crowded environments. By training a convolutional neural network model with a combination of synthetic and real-world data, dynamic object instance masks are learned in a semi-supervised way. The real-world data can be collected with a standard camera and requires minimal further post-processing. Our experiments show that a wide range of dynamic objects can be reliably detected using the presented method. Promising performance is demonstrated on our own and also publicly available datasets, which also shows the generalization capabilities of this approach.
研究动机与目标
- 提升视觉SLAM在高度动态城市环境中的鲁棒性,以应对移动物体对特征跟踪和地图一致性造成的干扰。
- 开发一种无需预定义语义类别或人工标注的动态物体实例检测方法。
- 仅使用标准RGB摄像头和最少后处理,实现实时、逐帧的动态实例分割。
- 通过真实世界与合成数据的组合,评估模型在多样化城市环境中的泛化能力。
提出的方法
- 基于Mask R-CNN的实例分割网络采用半监督方式训练,结合CARLA模拟器生成的合成数据与真实世界RGB视频片段。
- 模型主干网络先在合成数据上预训练,随后分两个阶段在真实世界数据上微调:首先仅训练头部,然后联合微调所有层。
- 利用基于运动一致性和外观变化检测的自监督方法,从真实世界数据中自动提取动态物体掩码。
- 训练采用50/50的真实与合成数据混合、仅真实数据和仅合成数据三种配置,以对比泛化性能。
- 最终模型在Cityscapes Fine数据集的二值掩码上通过F1分数进行评估,动态类别被合并为单一类别。
- 视频演示展示了在包含复杂动态元素(如树木、旗帜和动物)的城市场景中实时推理的效果。
实验结果
研究问题
- RQ1基于CNN的模型能否在不依赖预定义语义类别的情况下,检测城市场景中的通用动态物体实例?
- RQ2结合合成与真实世界数据在多大程度上影响动态实例分割在真实城市环境中的泛化能力?
- RQ3与纯合成数据训练相比,真实世界数据微调是否能显著提升动态场景分割的性能?
- RQ4自监督方法能否以最少的人工标注努力,从真实世界RGB序列中提取出准确的动态物体掩码?
- RQ5该模型在训练分布之外的未见城市和环境条件下,泛化能力如何?
主要发现
- 仅使用真实世界数据训练的模型(m_real)在Cityscapes数据集中所有测试城市的F1分数均达到最高,显著优于混合数据和仅合成数据训练的变体。
- 仅使用合成数据训练的模型(m_synth)表现出显著较低的F1性能,表明尽管在合成数据上进行了预训练,其对真实世界视觉变化的泛化能力仍较差。
- m_real模型在检测具有位置特异性的动态元素(如移动的树木、旗帜和动物)方面表现出更优能力,而仅在合成数据上训练的模型则未能识别这些元素。
- 合成数据预训练与真实世界数据微调的结合优于混合数据训练,表明当模拟与现实数据同时使用时,两者之间的域偏移会限制性能。
- 自监督掩码提取方法成功从真实世界视频中生成了高质量的动态实例掩码,仅需极少人工标注,从而实现了可扩展的数据采集。
- 定性结果证实,m_real在多样化城市场景中具有良好的泛化能力,包括不同天气、光照条件以及训练数据中未出现的动态物体类型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。