Skip to main content
QUICK REVIEW

[论文解读] Scene Understanding Networks for Autonomous Driving based on Around View Monitoring System

JeongYeol Baek, Ioana Veronica Chelu|arXiv (Cornell University)|May 18, 2018
Advanced Neural Network Applications参考文献 14被引用 5
一句话总结

本文提出了一种仅使用全景监控(AVM)系统中鱼眼相机的统一端到端深度学习框架,用于自动驾驶场景理解。该框架联合检测目标、检测路缘、分割可行驶区域,并通过底部点估计法估算最近障碍物的距离,在嵌入式TX2平台上实现了16.7 fps的推理速度,兼具高精度与低复杂度。

ABSTRACT

Modern driver assistance systems rely on a wide range of sensors (RADAR, LIDAR, ultrasound and cameras) for scene understanding and prediction. These sensors are typically used for detecting traffic participants and scene elements required for navigation. In this paper we argue that relying on camera based systems, specifically Around View Monitoring (AVM) system has great potential to achieve these goals in both parking and driving modes with decreased costs. The contributions of this paper are as follows: we present a new end-to-end solution for delimiting the safe drivable area for each frame by means of identifying the closest obstacle in each direction from the driving vehicle, we use this approach to calculate the distance to the nearest obstacles and we incorporate it into a unified end-to-end architecture capable of joint object detection, curb detection and safe drivable area detection. Furthermore, we describe the family of networks for both a high accuracy solution and a low complexity solution. We also introduce further augmentation of the base architecture with 3D object detection.

研究动机与目标

  • 通过仅依赖基于摄像头的系统,降低自动驾驶中LIDAR和多传感器融合的高成本。
  • 利用全景监控(AVM)系统中的鱼眼相机,提升停车和驾驶模式下的场景理解能力。
  • 设计一种统一的端到端深度学习架构,联合完成目标检测、路缘检测、可行驶区域分割和障碍物距离估计。
  • 通过平衡精度、推理速度(16.7 fps)和模型大小,优化在TX2平台上的嵌入式部署。
  • 在高精度版本中扩展框架,实现3D目标检测以估计方向和尺寸。

提出的方法

  • 使用360° AVM系统中鱼眼相机的输入,捕获车辆周围广角视野图像。
  • 提出底部点估计方法,从车辆各个方向识别最近的障碍物,实现精确的距离估计。
  • 设计一种统一的多任务网络(Unified-Net),采用共享编码器(深度乘数为0.5的MobileNet)和针对不同任务的专用解码头,分别用于目标检测、路缘检测和可行驶区域分割。
  • 采用单阶段检测(SSD)结合锚框实现高效的2D目标检测,并通过特征图融合实现多尺度检测。
  • 引入高精度的3D-Net变体,采用Inception-ResNet-V2编码器和密集上采样(HDUC)结构,用于预测3D目标的方向和尺寸。
  • 通过架构消融研究优化推理速度与精度,包括编码器大小、输入分辨率和Unified-Net中分支层的选择。

实验结果

研究问题

  • RQ1仅使用摄像头的AVM系统能否实现与多传感器系统相当的可靠场景理解能力,用于自动驾驶?
  • RQ2与标准的语义分割或目标检测相比,从鱼眼图像中进行底部点估计如何提升障碍物距离和可行驶区域检测的性能?
  • RQ3在TX2等嵌入式平台部署统一感知网络时,模型精度与推理速度之间的最优权衡是什么?
  • RQ4能否在不牺牲实时性能的前提下,将3D目标检测(方向与尺寸)有效集成到轻量化、端到端的架构中?
  • RQ5架构设计(如编码器选择、输入分辨率和分支层)如何影响多任务感知网络的性能?

主要发现

  • 统一的低复杂度解决方案在Nvidia TX2嵌入式平台上实现了16.7 fps的推理速度,满足自动驾驶的实时性要求。
  • 性能最佳的Unified-Net架构在'conv5'层进行分支,实现了2.77 MAE(距离估计)和0.55 mAP(目标检测)的平衡表现。
  • 采用深度乘数为0.5的MobileNet编码器与SSD解码器,在低复杂度解决方案中实现了精度与速度的最佳权衡。
  • 高精度3D-Net变体在'*-cycle'类别上实现了4.09°的方向MAE和0.132m的Z方向尺寸MAE。
  • 消融研究显示,将输入分辨率从全分辨率降低到640x360会降低精度但提升推理速度,而960x540提供了良好的平衡。
  • 采用Inception-ResNet-V2编码器与HDUC解码器的结构在底部点估计中实现了最低的MAE(3.7),优于FCN-A和FCN-B变体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。