[论文解读] Learning to Separate: Detecting Heavily-Occluded Objects in Urban Scenes
该论文提出了一种新颖的语义-几何非极大值抑制(SG-NMS)算法,通过联合学习边界框的语义与几何特征嵌入,提升了在严重遮挡的城市场景中的目标检测召回率。该方法集成于SG-Det模型,在KITTI和CityPersons数据集上实现了最先进性能,硬检测级别下提升3.84个百分点,且推理速度比领先方法快10倍。
While visual object detection with deep learning has received much attention in the past decade, cases when heavy intra-class occlusions occur have not been studied thoroughly. In this work, we propose a Non-Maximum-Suppression (NMS) algorithm that dramatically improves the detection recall while maintaining high precision in scenes with heavy occlusions. Our NMS algorithm is derived from a novel embedding mechanism, in which the semantic and geometric features of the detected boxes are jointly exploited. The embedding makes it possible to determine whether two heavily-overlapping boxes belong to the same object in the physical world. Our approach is particularly useful for car detection and pedestrian detection in urban scenes where occlusions often happen. We show the effectiveness of our approach by creating a model called SG-Det (short for Semantics and Geometry Detection) and testing SG-Det on two widely-adopted datasets, KITTI and CityPersons for which it achieves state-of-the-art performance.
研究动机与目标
- 解决标准NMS在城市场景中检测严重遮挡目标时表现不佳的问题。
- 在类内遮挡场景下提升检测召回率,同时不损失精度。
- 开发一种方法,能够区分来自同一物体的重叠框与来自不同物体的重叠框。
- 实现检测器的端到端训练,采用新型嵌入机制以同时捕捉语义与几何线索。
- 在严重遮挡条件下,于汽车与行人检测基准数据集上实现最先进性能。
提出的方法
- 提出一种语义-几何嵌入(SGE),联合编码边界框的语义特征(来自RoI对齐特征)与几何特征(IoU、长宽比、尺寸)。
- 设计一种新型损失函数,结合分离损失与聚类损失,用于训练SGE,确保来自同一物体的框在嵌入空间中彼此接近,而来自不同物体的框则被分离。
- 设计一种带有自注意力机制的串行区域全卷积网络(Serial R-FCN),以实现几何与语义特征的精确对齐,支持端到端训练。
- 开发SG-NMS,一种非极大值抑制的变体,利用SGE距离仅抑制来自同一物理对象的重复检测,从而保留被遮挡物体的真实正例。
- 在SGE损失中引入可学习的阈值参数ρ,以平衡噪声敏感性与语义区分能力,通过网格搜索进行优化。
- 将Serial R-FCN与SG-NMS整合为统一模型SG-Det,用于推理。
实验结果
研究问题
- RQ1学习得到的、结合语义与几何特征的嵌入是否能有效区分来自不同遮挡物体的重叠边界框?
- RQ2在严重遮挡目标检测基准上,SG-NMS是否在召回率与精度方面优于贪婪NMS与软NMS?
- RQ3所提出的SGE与SG-NMS是否可与检测器端到端联合训练,从而在不增加推理时间的前提下提升检测性能?
- RQ4SGE损失超参数ρ的选择如何影响不同遮挡水平下的性能表现?
- RQ5SG-Det在KITTI与CityPersons数据集的硬遮挡与严重遮挡设置下,达到最先进性能的程度如何?
主要发现
- SG-Det在KITTI测试集(中等难度)上达到95.81%的AP,排名榜单第三,相比第四名方法提升3.84个百分点。
- 在CityPersons数据集上,SG-NMS-Square将部分遮挡级别的漏检率降低至10.7%,严重遮挡级别降低至51.1%,优于先前方法。
- 与第四名方法相比,该方法在KITTI的硬检测级别下将召回率提升3.84个百分点,同时保持0.20秒的快速推理时间。
- SGE损失的最优ρ值为0.27;低于或高于此阈值均会导致性能下降,原因分别为噪声敏感性过高或语义区分能力不足。
- SG-NMS-Linear与SG-NMS-Square在合理难度级别下分别将漏检率降低0.2与0.7个百分点,表明在不同遮挡水平下均具有一致的性能增益。
- 尽管精度更高,该模型推理速度仍比顶级方法如RRC与SenseKITTI快十余倍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。