Skip to main content
QUICK REVIEW

[论文解读] BLVD: Building A Large-scale 5D Semantics Benchmark for Autonomous Driving

Jianru Xue, Jianwu Fang|arXiv (Cornell University)|Mar 15, 2019
Advanced Neural Network Applications参考文献 27被引用 15
一句话总结

本文提出了BLVD,一个大规模的5D语义基准,用于自动驾驶,支持超越静态3D检测与分割的高级任务,包括4D跟踪、5D交互事件识别和5D意图预测。该基准包含249,129个3D标注、214,922个点上的4,902个被跟踪实例、6,004个事件识别片段以及4,900个意图预测样本,数据在不同条件下(白天/夜晚、城市/高速公路、低密度/高密度)采集,包含同步的激光雷达、摄像头和GPS/IMU数据,支持动态场景理解的端到端学习。

ABSTRACT

In autonomous driving community, numerous benchmarks have been established to assist the tasks of 3D/2D object detection, stereo vision, semantic/instance segmentation. However, the more meaningful dynamic evolution of the surrounding objects of ego-vehicle is rarely exploited, and lacks a large-scale dataset platform. To address this, we introduce BLVD, a large-scale 5D semantics benchmark which does not concentrate on the static detection or semantic/instance segmentation tasks tackled adequately before. Instead, BLVD aims to provide a platform for the tasks of dynamic 4D (3D+temporal) tracking, 5D (4D+interactive) interactive event recognition and intention prediction. This benchmark will boost the deeper understanding of traffic scenes than ever before. We totally yield 249,129 3D annotations, 4,902 independent individuals for tracking with the length of overall 214,922 points, 6,004 valid fragments for 5D interactive event recognition, and 4,900 individuals for 5D intention prediction. These tasks are contained in four kinds of scenarios depending on the object density (low and high) and light conditions (daytime and nighttime). The benchmark can be downloaded from our project site https://github.com/VCCIV/BLVD/.

研究动机与目标

  • 解决自动驾驶研究中缺乏大规模、时间一致且具备交互性的5D语义基准的问题。
  • 实现对动态交通场景的更深层次理解,超越静态3D检测与语义分割。
  • 提供一个统一平台,用于评估4D跟踪、5D交互事件识别与5D意图预测,并采用标准化指标。
  • 在多样化的真实驾驶条件下,收集并标注高质量、同步的多传感器数据(激光雷达、摄像头、GPS/IMU)。
  • 通过将3D检测、跟踪、事件识别与意图预测整合到单一基准框架中,支持端到端学习流程。

提出的方法

  • 该基准基于配备Velodyne HDL-64E激光雷达、双高分辨率摄像头(1920×500)和GPS/IMU系统的自动驾驶平台构建,所有传感器自动同步并校准。
  • 采用快速在线校准方法,在120,000帧内实现激光雷达与摄像头数据的精确配准,达到10Hz的完整同步。
  • 对249,129个实例标注了3D边界框,并在多样化场景中对4,902个个体在214,922个轨迹点上进行了跟踪。
  • 对6,004个片段标注了5D交互事件,捕捉对象与自车之间的交互,包括事件状态与几何结构。
  • 意图预测采用基于LSTM的网络,预测未来5–10步的3D边界框位置、朝向及事件状态。
  • 评估指标包括位置的ADE与FDE,朝向与3D框重叠(使用PASCAL VOC标准)的ADE与FDE,以及当IoU < 50%时对误预测施加δ惩罚。

实验结果

研究问题

  • RQ1如何构建一个大规模5D语义基准,以支持自动驾驶中的动态4D跟踪与5D交互事件识别?
  • RQ2在包含完整5D标注的多样化真实驾驶场景中训练时,意图预测模型的性能极限是什么?
  • RQ3在5D意图预测任务中,预测精度与误差如何随不同观测与预测时序跨度而变化?
  • RQ45D语义信息(包括事件状态与3D几何结构)的引入在多大程度上提升了自动驾驶感知系统的鲁棒性?
  • RQ5整合3D检测、跟踪、事件识别与意图预测的统一基准,能否实现更好的模型泛化能力与任务迁移?

主要发现

  • 5D意图预测模型在五步观测与五步预测设置下,对行人轨迹的平均位移误差(ADE)为0.34米,最终位移误差(FDE)为0.49米。
  • 对于车辆,相同五五预测设置下,ADE为0.47米,FDE为0.69米,表明性能中等但稳定。
  • 更长的预测时序(如十步预测)导致误差增加,车辆的FDE达到1.12米,表明时间越长不确定性越高。
  • 十步观测、五步预测设置(十-五)使车辆的ADE降低至0.38米,FDE降低至0.57米,表明更长的观测序列可提升预测精度。
  • 使用3D框重叠度量(s(V, V̂))与余弦惩罚的朝向误差,提升了对几何与方向预测精度的评估效果。
  • 该基准支持多模态评估,包括事件状态预测的精确率、召回率与平均精确率(AP),可实现对交互行为理解的全面评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。