Skip to main content
QUICK REVIEW

[论文解读] Dense Semantic 3D Map Based Long-Term Visual Localization with Hybrid Features

Tianxin Shi, Hainan Cui|arXiv (Cornell University)|May 21, 2020
Robotics and Sensor-Based Localization参考文献 52被引用 5
一句话总结

该论文提出了一种混合视觉定位方法,结合密集语义3D地图与手工设计(SIFT)和学习得到(R2D2)特征,以提升在长期外观变化下的鲁棒性。通过在加权RANSAC PnP求解器中引入来自密集语义3D模型的语义一致性得分作为软约束,该方法在Aachen Day-Night和RobotCar Seasons基准上实现了最先进性能,在具有挑战性的昼夜和季节性条件下优于先前方法。

ABSTRACT

Visual localization plays an important role in many applications. However, due to the large appearance variations such as season and illumination changes, as well as weather and day-night variations, it's still a big challenge for robust long-term visual localization algorithms. In this paper, we present a novel visual localization method using hybrid handcrafted and learned features with dense semantic 3D map. Hybrid features help us to make full use of their strengths in different imaging conditions, and the dense semantic map provide us reliable and complete geometric and semantic information for constructing sufficient 2D-3D matching pairs with semantic consistency scores. In our pipeline, we retrieve and score each candidate database image through the semantic consistency between the dense model and the query image. Then the semantic consistency score is used as a soft constraint in the weighted RANSAC-based PnP pose solver. Experimental results on long-term visual localization benchmarks demonstrate the effectiveness of our method compared with state-of-the-arts.

研究动机与目标

  • 解决在昼夜、季节和天气变化等显著外观变化下的视觉定位挑战。
  • 克服稀疏3D模型和传统特征描述符(如SIFT)在外观变化下性能退化的局限性。
  • 通过将高层语义信息整合到几何匹配流程中,提升定位鲁棒性。
  • 开发一个统一框架,有效结合手工设计与学习特征,利用密集语义3D地图。
  • 通过语义一致性评分作为软约束,提升候选图像检索和姿态估计的准确性。

提出的方法

  • 使用现成的多视图立体(MVS)方法构建密集语义3D地图,以替代稀疏SfM模型。
  • 同时使用SIFT(手工设计)和R2D2(学习得到)特征,以实现在多样化成像条件下的鲁棒特征匹配。
  • 利用混合特征进行图像检索,并基于3D-2D语义对应关系,计算查询图像与数据库图像之间的语义一致性得分。
  • 将语义一致性得分作为软约束,应用于基于加权RANSAC的PnP姿态求解器中,以优化相机姿态估计。
  • 利用语义地图中的密集3D点,相比稀疏模型,提升语义一致性得分的判别能力。
  • 通过实例分割或语义分割将语义标签集成到3D地图中,以实现语义感知匹配。

实验结果

研究问题

  • RQ1结合手工设计与学习特征是否能提升在显著外观变化下的视觉定位鲁棒性?
  • RQ2与稀疏模型相比,密集语义3D地图在多大程度上增强了语义一致性得分的判别能力?
  • RQ3将语义一致性作为软约束,能在多大程度上提升长期定位中的姿态估计精度?
  • RQ4所提出方法是否能在具有极端外观变化(如昼夜和季节变化)的基准上超越最先进方法?
  • RQ5当查询图像与数据库图像拍摄方向相反时,该方法表现如何?

主要发现

  • 在Aachen Day-Night数据集中,该方法在0.25m/0.50m/5.0m阈值下的准确率分别为89.3% / 95.4% / 97.6%,在2°/5°/10°阈值下的准确率分别为44.9% / 67.3% / 87.8%,优于所有基线方法,仅在一项粗粒度精度指标上略逊于RT-PA-IR+CRBNet。
  • 消融实验表明,移除语义一致性得分后,mAP在白天提升8.8%,在夜间提升2.0%,验证了语义评分的有效性。
  • 在RobotCar Seasons数据集中,该方法在0.25m/0.50m/5.0m阈值下的准确率分别为54.6% / 81.9% / 96.9%,在2°/5°/10°阈值下的准确率分别为14.8% / 33.0% / 51.3%,尽管面临反向查询的挑战,但在提交时排名第一。
  • SIFT在白天条件下表现最佳,而R2D2在夜间表现更优,证实了混合特征的互补优势。
  • 混合特征方法(SIFT + R2D2)在所有条件下均优于单独使用任一特征类型,表现更优。
  • 密集语义3D地图相比稀疏模型,能提供更可靠且更具判别力的语义一致性得分,从而提升检索准确性和姿态估计的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。