Skip to main content
QUICK REVIEW

[论文解读] Crowdsourced 3D Mapping: A Combined Multi-View Geometry and Self-Supervised Learning Approach

Hemang Chawla, Matti Jukola|arXiv (Cornell University)|Jul 25, 2020
Robotics and Sensor-Based Localization参考文献 48被引用 7
一句话总结

本文提出了一种基于众包的3D交通标志地图构建框架,通过联合利用多视角几何与自监督深度学习,从单目RGB视频和GPS数据中估计相机内参、深度和自身运动,从而在无需已知相机参数的前提下实现高精度的3D标志定位。该方法在所有序列中实现了0.39 m的平均相对定位误差和1.26 m的平均绝对误差,优于以往需要已知内参或额外传感器的方法。

ABSTRACT

The ability to efficiently utilize crowdsourced visual data carries immense potential for the domains of large scale dynamic mapping and autonomous driving. However, state-of-the-art methods for crowdsourced 3D mapping assume prior knowledge of camera intrinsics. In this work, we propose a framework that estimates the 3D positions of semantically meaningful landmarks such as traffic signs without assuming known camera intrinsics, using only monocular color camera and GPS. We utilize multi-view geometry as well as deep learning based self-calibration, depth, and ego-motion estimation for traffic sign positioning, and show that combining their strengths is important for increasing the map coverage. To facilitate research on this task, we construct and make available a KITTI based 3D traffic sign ground truth positioning dataset. Using our proposed framework, we achieve an average single-journey relative and absolute positioning accuracy of 39cm and 1.26m respectively, on this dataset.

研究动机与目标

  • 通过使用消费级传感器在无需相机预标定的情况下,实现大规模、低成本的3D交通标志地图构建。
  • 解决在众包视觉数据中相机内参未知或变化带来的3D重建挑战。
  • 通过融合多视角几何与基于深度学习的自标定、深度估计和自身运动估计,提升地图覆盖范围与精度。
  • 提供一个公开可用的基于KITTI的3D交通标志真实标注数据集,用于基准测试。

提出的方法

  • 该框架以单目RGB图像和GPS数据作为输入,消除了对已标定传感器或IMU的依赖。
  • 采用多视角几何技术(如COLMAP)通过结构从运动和捆绑调整实现自标定与自身运动估计。
  • 使用自监督深度学习模型(Monodepth2和VITW)进行单目深度与自身运动估计,训练过程无需真实深度监督。
  • 采用混合方法,结合基于几何的跟踪(ORB-SLAM,带/不带回环检测)与学习得到的深度图,实现交通标志的三维位置三角测量。
  • 通过多视角三角测量估计标志位置,利用自标定结果优化相机投影矩阵。
  • 系统通过相对误差与绝对误差在多个序列中评估性能,并对不同标定与估计方法进行消融实验。

实验结果

研究问题

  • RQ1当相机内参未知时,3D交通标志三角测量的精度在多大程度上依赖于自标定的精度?
  • RQ2基于几何的方法与基于深度学习的方法在众包地图中的自标定、深度估计与自身运动估计方面,性能表现如何比较?
  • RQ3结合多视角几何与自监督学习的混合框架是否能相比纯几何或纯学习方法,提升地图覆盖范围与3D标志定位精度?
  • RQ4仅使用GPS数据与单目视觉的方法,在3D标志定位精度方面,与使用IMU或已知内参等额外传感器的系统相比表现如何?

主要发现

  • 所提出的框架在所有序列中实现了0.39 m的平均相对3D交通标志定位误差与1.26 m的平均绝对误差,证明了在无需已知相机内参的情况下仍具备高精度。
  • 结合ORB-SLAM回环检测与COLMAP自标定的方法取得了最佳的相对定位性能,当按每个标志归一化时,相对误差为0.24 m。
  • 对于发生跟踪失败的序列(如Seq 1),采用Monodepth2进行深度估计、COLMAP进行标定的Approach B表现最佳,误差为0.58 m(相对误差),表明在复杂条件下具有鲁棒性。
  • 通过COLMAP或VITW(m)实现的自标定显著提升了标志定位精度,相比无标定情况,证实了内参估计的重要性。
  • 混合框架优于纯几何方法与纯深度学习方法,尤其在长轨迹与特征稀疏环境中的表现更优。
  • 开源的基于KITTI的3D交通标志真实标注数据集为未来众包地图方法的可复现评估与基准测试提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。