Skip to main content
QUICK REVIEW

[论文解读] Confidence Guided Stereo 3D Object Detection with Split Depth Estimation

Chengyao Li, Jason S. Ku|arXiv (Cornell University)|Mar 11, 2020
Advanced Vision and Imaging参考文献 36被引用 12
一句话总结

本文提出 CG-Stereo,一种基于置信度引导的立体三维目标检测框架,该框架为前景和背景像素分别使用独立的深度解码器,并利用置信度估计作为检测器中的软注意力机制。该方法在 KITTI 基准测试中达到最先进性能,在 0.7 IoU 下,对汽车、行人和骑行人分别超越先前基于立体视觉的方法 1.4%、6.7% 和 12.7% 的平均精度(AP)。

ABSTRACT

Accurate and reliable 3D object detection is vital to safe autonomous driving. Despite recent developments, the performance gap between stereo-based methods and LiDAR-based methods is still considerable. Accurate depth estimation is crucial to the performance of stereo-based 3D object detection methods, particularly for those pixels associated with objects in the foreground. Moreover, stereo-based methods suffer from high variance in the depth estimation accuracy, which is often not considered in the object detection pipeline. To tackle these two issues, we propose CG-Stereo, a confidence-guided stereo 3D object detection pipeline that uses separate decoders for foreground and background pixels during depth estimation, and leverages the confidence estimation from the depth estimation network as a soft attention mechanism in the 3D object detector. Our approach outperforms all state-of-the-art stereo-based 3D detectors on the KITTI benchmark.

研究动机与目标

  • 通过提升前景物体的深度估计精度,弥合基于立体视觉与基于 LiDAR 的三维目标检测之间的性能差距。
  • 解决立体深度估计精度的高方差问题,尤其是在更远距离和物体边界处。
  • 将深度预测中的不确定性估计整合为三维检测器中的软注意力机制,以提升检测的鲁棒性。
  • 仅使用立体图像,在 KITTI 三维目标检测基准上展示最先进性能。

提出的方法

  • 立体匹配网络采用两个独立的解码器——一个用于前景像素,一个用于背景像素——并利用语义分割掩码来引导分离过程。
  • 在训练过程中应用点云损失,以保留物体形状并提升深度估计精度,尤其针对远距离或复杂物体。
  • 将深度估计网络生成的置信度图作为额外通道添加到点云中,作为三维检测器中的软注意力机制。
  • 三维目标检测器处理经过置信度增强的点云,使其能够聚焦于高置信度、高精度的深度点,同时抑制噪声或模糊的点。
  • 整个流程端到端训练,深度估计与三维检测分支联合优化。
  • 使用语义分割掩码在深度估计过程中分离前景与背景,以改善对物体特定深度模式的学习。

实验结果

研究问题

  • RQ1为前景和背景像素分别进行深度估计是否能提升基于立体视觉系统的三维目标检测性能?
  • RQ2将深度预测的置信度估计作为软注意力机制是否能增强三维检测器的鲁棒性与精度?
  • RQ3采用点云损失的分离深度估计如何影响远距离或困难物体的深度估计精度?
  • RQ4当使用高质量语义分割掩码时,该方法的性能上限是多少?

主要发现

  • 所提方法在 KITTI 基准测试中对汽车的 0.7 IoU 下平均精度(AP)达到 57.58%,比次佳方法高出 1.4%。
  • 对行人,该方法相比次佳的基于立体视觉方法,AP 提升 6.7%。
  • 对骑行人,该方法 AP 提升 12.7%,在小尺寸和挑战性物体类别上表现出显著优势。
  • 消融实验表明,仅使用分离深度估计即可使 AP 提升 1.81%,BEV 下的 AP(AP_BEV)提升 1.31%。
  • 增加点云损失后,AP 进一步提升 2.27%,AP_BEV 提升 0.29%。
  • 引入置信度作为软注意力机制可使 AP 提升 1.02%,AP_BEV 提升 1.73%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。