Skip to main content
QUICK REVIEW

[论文解读] Detecting Unexpected Obstacles for Self-Driving Cars: Fusing Deep Learning and Geometric Modeling

Sebastian Ramos, Stefan Gehrig|arXiv (Cornell University)|Dec 20, 2016
Autonomous Vehicle Technology and Safety被引用 4
一句话总结

该论文提出了一种新颖的融合框架,结合基于深度学习的语义分割与立体几何技术,用于检测小型、意外的路面障碍物(如散落的货物)。通过贝叶斯概率融合语义分割与立体Stixel输出,利用外观、上下文和三维几何线索,系统在检测率上实现了50%的相对提升,在50米距离处检测率超过90%,并以22 Hz的实时速度运行。

ABSTRACT

The detection of small road hazards, such as lost cargo, is a vital capability for self-driving cars. We tackle this challenging and rarely addressed problem with a vision system that leverages appearance, contextual as well as geometric cues. To utilize the appearance and contextual cues, we propose a new deep learning-based obstacle detection framework. Here a variant of a fully convolutional network is used to predict a pixel-wise semantic labeling of (i) free-space, (ii) on-road unexpected obstacles, and (iii) background. The geometric cues are exploited using a state-of-the-art detection approach that predicts obstacles from stereo input images via model-based statistical hypothesis tests. We present a principled Bayesian framework to fuse the semantic and stereo-based detection results. The mid-level Stixel representation is used to describe obstacles in a flexible, compact and robust manner. We evaluate our new obstacle detection system on the Lost and Found dataset, which includes very challenging scenes with obstacles of only 5 cm height. Overall, we report a major improvement over the state-of-the-art, with relative performance gains of up to 50%. In particular, we achieve a detection rate of over 90% for distances of up to 50 m. Our system operates at 22 Hz on our self-driving platform.

研究动机与目标

  • 解决检测小型、意外路面障碍物(如散落货物)这一关键但研究不足的挑战。
  • 通过引入深度学习中的外观和上下文线索,克服仅依赖几何方法的局限性。
  • 开发一种鲁棒的、实时的感知系统,能够在高达50米的距离内检测高度低至5厘米的障碍物。
  • 在复杂多变的路面条件下,降低误报率的同时保持高检测率。
  • 构建一种基于原理的、概率性的融合框架,整合语义与几何检测输出。

提出的方法

  • 采用全卷积网络(FCN)变体对像素进行语义标记,划分为自由区域、路面上的障碍物和背景,以利用外观和上下文信息。
  • 基于立体视觉的系统采用FPHT算法与统计假设检验,通过Stixel表示生成三维障碍物检测结果。
  • 采用贝叶斯融合框架,结合语义与几何检测结果,利用置信度分数和障碍物先验信息。
  • Stixel表示法在两种模态间实现紧凑、灵活且鲁棒的中层障碍物描述。
  • 融合过程通过概率推理结合语义与几何来源的证据,使用置信度阈值控制误报。
  • 系统针对实时性能进行优化,在配备立体视觉硬件加速的自动驾驶平台上以22 Hz运行。

实验结果

研究问题

  • RQ1深度学习模型能否通过利用外观和上下文线索,有效检测形状和外观差异极大的小型、意外路面障碍物?
  • RQ2如何可靠地将立体视觉的几何线索与语义分割结果结合,以提升对低矮障碍物的检测能力?
  • RQ3如何最优地融合语义与几何检测系统产生的概率输出,以最大化检测率并最小化误报?
  • RQ4所学习的背景类别在多大程度上能泛化到未见过的障碍物,同时保持对路面表面变化和光照变化的鲁棒性?
  • RQ5该融合框架在真实世界挑战(如弯曲道路、阴影、校准漂移)下的表现如何?

主要发现

  • 与SOTA方法相比,该系统在Lost and Found数据集上的检测率实现了50%的相对提升。
  • 即使障碍物高度低至5厘米,系统在50米距离内的检测率仍超过90%。
  • 与SOTA相比,误报率降低了13%,实际驾驶中每2公里仅出现一次误报。
  • 融合系统成功恢复了单一模态中漏检的障碍物,例如当UON因背景类别混淆而漏检,或立体系统对小型障碍物失效时。
  • 系统在自动驾驶平台上以22 Hz实时运行,端到端延迟为:SGM 45 ms,FPHT 35 ms,UON 40 ms(专用硬件上)。
  • 概率融合框架可通过置信度阈值直观控制误报,当阈值达到0.7时仍能保持高检测率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。