Skip to main content
QUICK REVIEW

[论文解读] Ground-aware Monocular 3D Object Detection for Autonomous Driving

Yuxuan Liu, Yixuan Yuan|arXiv (Cornell University)|Feb 1, 2021
Robotics and Sensor-Based Localization参考文献 37被引用 6
一句话总结

本文提出了一种基于地面的单目3D目标检测框架,通过显式利用地面平面先验,提升了深度估计和3D定位精度。该方法引入了锚框过滤机制,以抑制远离地面的3D锚框,并设计了一种地面感知卷积模块,通过引导来自向下偏好感受野的特征聚合,实现了KITTI 3D检测与深度预测基准上的最先进性能。

ABSTRACT

Estimating the 3D position and orientation of objects in the environment with a single RGB camera is a critical and challenging task for low-cost urban autonomous driving and mobile robots. Most of the existing algorithms are based on the geometric constraints in 2D-3D correspondence, which stems from generic 6D object pose estimation. We first identify how the ground plane provides additional clues in depth reasoning in 3D detection in driving scenes. Based on this observation, we then improve the processing of 3D anchors and introduce a novel neural network module to fully utilize such application-specific priors in the framework of deep learning. Finally, we introduce an efficient neural network embedded with the proposed module for 3D object detection. We further verify the power of the proposed module with a neural network designed for monocular depth prediction. The two proposed networks achieve state-of-the-art performances on the KITTI 3D object detection and depth prediction benchmarks, respectively. The code will be published in https://www.github.com/Owen-Liuyuxuan/visualDet3D

研究动机与目标

  • 通过利用在标准2D-3D对应方法中常被忽略的地面平面先验,提升自动驾驶场景下单目3D目标检测的性能。
  • 通过在深度学习模型中显式引入来自地面平面的几何约束作为归纳偏置,缓解单目3D检测的病态问题。
  • 通过设计一种显式推理物体与地面平面接触点的神经网络,提升深度推理与3D定位精度。
  • 通过轻量级、单阶段推理框架,在KITTI 3D目标检测与单目深度预测基准上实现最先进性能。

提出的方法

  • 引入锚框过滤机制,在训练与推理过程中移除远离地面平面的3D锚框,缩小网络的搜索空间,使其聚焦于更合理的物体位置。
  • 设计一种地面感知卷积模块,为每个像素编码先验深度值,并引导从每个特征点下方像素聚合特征,实现向下偏置的感受野。
  • 利用相机参数与透视几何将2D锚框反投影至3D空间,使网络能够推理物体与地面的接触点。
  • 将地面感知卷积模块嵌入单阶段检测器与基于U-Net的深度预测网络中,使两者均能受益于地面平面先验。
  • 以可微方式应用该模块,支持使用标准反向传播与优化方法进行端到端训练。
  • 采用多任务学习设置,检测器联合预测3D边界框与深度,地面感知模块增强两个任务的特征表示能力。

实验结果

研究问题

  • RQ1显式建模地面平面是否能提升自动驾驶场景下单目3D目标检测的性能?
  • RQ2基于锚框与地面平面距离的过滤机制对检测精度与训练效率有何影响?
  • RQ3在何种程度上,神经网络可借助几何先验与结构化感受野来推理物体与地面的接触点?
  • RQ4在单目设置中,引入地面感知特征是否能提升深度预测性能?
  • RQ5与现有最先进方法相比,该方法在精度与推理速度方面表现如何?

主要发现

  • 所提出的锚框过滤方法在硬样本(3D IoU ≥ 0.7)上将3D检测性能提升了2.24%(基线从12.06%提升至11.11%的消融模型),表明分类分支的学习负担显著降低。
  • 地面感知卷积模块在硬样本上(IoU ≥ 0.7)实现了3.08%的绝对性能提升,硬样本mAP达到22.16%,优于基线。
  • 完整模型在KITTI 3D检测基准上达到最先进性能,在中等与硬难度设置下均优于先前的单目方法。
  • 在单目深度预测任务中应用该模块后,取得了具有竞争力的结果,验证了其在检测任务之外的泛化能力。
  • 该网络在现代GPU上运行速度约为20 FPS,证明了其在自动驾驶应用中的实时可行性。
  • 消融实验表明,地面感知模块显著优于可变形卷积与视差条件卷积,充分证明了所设计归纳偏置的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。