Skip to main content
QUICK REVIEW

[论文解读] Stereo Vision-based Semantic 3D Object and Ego-motion Tracking for Autonomous Driving

Peiliang Li, Tong Qin|arXiv (Cornell University)|Jul 5, 2018
Robotics and Sensor-Based Localization参考文献 28被引用 10
一句话总结

本文提出了一种基于双目视觉的系统,通过紧密融合2D目标检测、视角分类和稀疏特征跟踪,实现在动态驾驶场景中鲁棒且时序一致的3D语义目标与自运动跟踪。通过融合语义先验、动态目标束调整(bundle adjustment)以及运动学运动模型,该方法实现了高精度、实例级别的3D目标位姿与速度估计,并具备出色的时序一致性,在自运动估计与3D定位精度方面优于当前最先进方法。

ABSTRACT

We propose a stereo vision-based approach for tracking the camera ego-motion and 3D semantic objects in dynamic autonomous driving scenarios. Instead of directly regressing the 3D bounding box using end-to-end approaches, we propose to use the easy-to-labeled 2D detection and discrete viewpoint classification together with a light-weight semantic inference method to obtain rough 3D object measurements. Based on the object-aware-aided camera pose tracking which is robust in dynamic environments, in combination with our novel dynamic object bundle adjustment (BA) approach to fuse temporal sparse feature correspondences and the semantic 3D measurement model, we obtain 3D object pose, velocity and anchored dynamic point cloud estimation with instance accuracy and temporal consistency. The performance of our proposed method is demonstrated in diverse scenarios. Both the ego-motion estimation and object localization are compared with the state-of-of-the-art solutions.

研究动机与目标

  • 解决端到端3D目标检测方法的局限性,后者需要大量3D标注且在动态驾驶场景中缺乏时序一致性。
  • 通过利用对物体敏感的相机位姿跟踪方法,提升在动态环境中自运动估计的鲁棒性,使其对运动物体不敏感。
  • 通过结合语义与几何测量的紧密耦合优化框架,实现时序一致的3D目标状态估计(位姿、速度与稀疏点云)。
  • 通过运动建模与特征几何约束,实现对近处与远处目标(包括严重截断或遮挡情况)的精确且稳定跟踪。
  • 通过与最先进方法的定量比较,展示系统在多样化真实驾驶场景下的实用性。

提出的方法

  • 系统采用基于2D目标检测与离散视角分类的轻量化3D框推理方法,生成初始3D目标测量值与遮挡掩码。
  • 采用对物体敏感的视觉里程计框架,将动态物体从相机位姿估计中分离,确保在复杂场景中仍能实现鲁棒的自运动跟踪。
  • 提出一种新型的动态目标束调整(BA)方法,将时间序列中的稀疏特征对应关系与语义3D测量值融合,联合优化目标状态与相机位姿。
  • 对检测到的车辆应用运动学运动模型,以强化方向与速度估计的一致性,尤其适用于远距离或低可见度目标。
  • 在分层优化流程中整合语义测量、特征观测、运动模型与点云配准,以优化3D目标估计。
  • 该框架设计用于实现实例级别的时序一致性跟踪,即使在严重遮挡或截断等极端情况下亦能保持稳定。

实验结果

研究问题

  • RQ1基于2D检测与视角分类的轻量化3D目标推理方法,是否能在无需密集3D标注的情况下实现准确且一致的3D目标估计?
  • RQ2如何紧密耦合语义先验与几何特征约束,以在动态场景条件下提升3D目标跟踪的时序一致性?
  • RQ3运动学运动模型在多大程度上可增强对远距离或观测不良车辆的3D目标跟踪稳定性?
  • RQ4通过利用对物体敏感的相机跟踪方法,系统是否能在存在动态物体的情况下保持鲁棒的自运动估计?
  • RQ5多线索(语义、特征、运动、点云)的融合在不同目标难易程度下,对3D目标定位精度有何影响?

主要发现

  • 所提方法在易、中、难三类目标上的平均3D定位误差分别为5.9%、6.1%与6.3%,其中一半真阳性样本的误差低于5%。
  • 系统在鸟瞰图下(IoU=0.25)达到88.07%的平均精度(AP),在3D框AP(IoU=0.25)下达到86.57%(易类目标),在集成所有线索时,多数指标优于3DOP。
  • 加入特征观测显著提升了近处目标的性能(例如,易类目标在鸟瞰图下AP提升约10%),而运动建模则提高了远距离或小目标的精度。
  • 系统在极端截断情况下仍能保持稳定跟踪,而2D检测方法在此类情况下会失效,这得益于时序几何约束与运动建模。
  • 集成所有组件(语义、特征、运动、点云)的完整系统每帧推理时间为173ms,证明了其具备实时可行性。
  • 该方法在动态环境中表现出强鲁棒性,由于采用对物体敏感的相机跟踪,自运动估计不受运动物体影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。