Skip to main content
QUICK REVIEW

[论文解读] Visibility Guided NMS: Efficient Boosting of Amodal Object Detection in Crowded Traffic Scenes

Nils Gählert, Niklas Hanselmann|arXiv (Cornell University)|Jun 15, 2020
Advanced Neural Network Applications参考文献 36被引用 18
一句话总结

本文提出了一种新型高效的NMS变体——可见性引导NMS(vg-NMS),通过结合基于像素的预测与非可视边界框预测,提升了在拥挤交通场景中对非可视物体的检测性能。通过利用基于像素的边界框提供的可见性线索来指导抑制过程,vg-NMS有效减少了对高度遮挡物体的误抑制,仅带来6.2%的平均运行时增加,实现了当前最优的检测性能。

ABSTRACT

Object detection is an important task in environment perception for autonomous driving. Modern 2D object detection frameworks such as Yolo, SSD or Faster R-CNN predict multiple bounding boxes per object that are refined using Non-Maximum-Suppression (NMS) to suppress all but one bounding box. While object detection itself is fully end-to-end learnable and does not require any manual parameter selection, standard NMS is parametrized by an overlap threshold that has to be chosen by hand. In practice, this often leads to an inability of standard NMS strategies to distinguish different objects in crowded scenes in the presence of high mutual occlusion, e.g. for parked cars or crowds of pedestrians. Our novel Visibility Guided NMS (vg-NMS) leverages both pixel-based as well as amodal object detection paradigms and improves the detection performance especially for highly occluded objects with little computational overhead. We evaluate vg-NMS using KITTI, VIPER as well as the Synscapes dataset and show that it outperforms current state-of-the-art NMS.

研究动机与目标

  • 解决标准NMS在拥挤场景中的局限性,即因高IoU重叠而错误抑制高度遮挡的非可视物体。
  • 在不引入额外子网络或显著计算开销的前提下,提升非可视物体检测性能。
  • 通过可见性感知的抑制策略,实现在自动驾驶场景中对遮挡车辆和行人进行鲁棒检测。
  • 证明联合预测基于像素的边界框与非可视边界框可增强检测泛化能力,并实现有效的NMS引导。

提出的方法

  • vg-NMS利用单个网络输出的基于像素的边界框和非可视边界框预测结果来指导抑制过程,避免依赖固定的IoU阈值。
  • 采用可见性感知的抑制策略,根据预测区域的可见程度对检测结果进行优先级排序,从而在遮挡情况下减少误报。
  • 通过在标准NMS中引入基于可见性的过滤机制,可无缝集成至YOLO、SSD和Faster R-CNN等现有目标检测器中。
  • 网络采用L2损失进行定位优化,Focal Loss进行分类优化,实现两种检测范式端到端的联合优化。
  • vg-NMS利用基于像素的边界框本身重叠度低于非可视边界框的特性,在与Soft NMS结合时,显著减少了候选配对数量。
  • 该方法仅需对两种框类型使用标准真实标注(GT),无需复杂的架构修改或辅助头结构。

实验结果

研究问题

  • RQ1基于像素边界框的可见性线索是否能改善NMS在高度遮挡场景下的抑制行为?
  • RQ2联合预测基于像素的边界框与非可视边界框是否能带来更好的泛化能力与检测性能提升?
  • RQ3vg-NMS是否能在不引入显著计算成本的前提下,优于标准NMS与Soft NMS,在拥挤交通场景中表现更优?
  • RQ4双框预测的多任务学习设置在多大程度上提升了单任务检测性能?
  • RQ5在KITTI、VIPER和Synscapes等基准数据集上,vg-NMS在mAP与推理速度方面的表现如何?

主要发现

  • vg-NMS在所有评估数据集上均优于标准NMS与Soft NMS,尤其在VIPER与Synscapes(高密度物体场景)中性能提升最为显著。
  • 在Synscapes数据集上,vg-NMS实现了86.67%的非可视检测平均精度(mAP),超过单任务基线的85.31%。
  • 将Soft NMS与vg-NMS结合可进一步提升性能,尤其有效降低了在拥挤场景中的抑制错误。
  • vg-NMS仅带来相比标准NMS平均6.2%的运行时增加,总开销不足2ms,得益于对已有预测结果的高效复用。
  • 联合基于像素与非可视检测的多任务设置,使KITTI数据集上单任务mAP提升最高达1.2%,Synscapes上提升1.3%,表明特征泛化能力更强。
  • 该方法兼容所有现代检测器(如YOLO、SSD与Faster R-CNN),可即插即用,轻松集成至现有检测流程中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。