[论文解读] Learning Pairwise Relationship for Multi-object Detection in Crowded Scenes
本文提出 Pairwise-NMS,一种可学习的非极大值抑制方法,用于替代多目标检测流程中的 GreedyNMS。通过使用深度成对关系网络,将重叠的候选框对分类为包含零个、一个或两个目标,显著提升了在人群密集、遮挡严重的场景下的检测精度——尤其在 MOT15、TUD-Crossing 和 PETS 数据集上表现突出,且未牺牲效率,可无缝集成至 Faster R-CNN 和 DPM 检测器中。
As the post-processing step for object detection, non-maximum suppression (GreedyNMS) is widely used in most of the detectors for many years. It is efficient and accurate for sparse scenes, but suffers an inevitable trade-off between precision and recall in crowded scenes. To overcome this drawback, we propose a Pairwise-NMS to cure GreedyNMS. Specifically, a pairwise-relationship network that is based on deep learning is learned to predict if two overlapping proposal boxes contain two objects or zero/one object, which can handle multiple overlapping objects effectively. Through neatly coupling with GreedyNMS without losing efficiency, consistent improvements have been achieved in heavily occluded datasets including MOT15, TUD-Crossing and PETS. In addition, Pairwise-NMS can be integrated into any learning based detectors (Both of Faster-RCNN and DPM detectors are tested in this paper), thus building a bridge between GreedyNMS and end-to-end learning detectors.
研究动机与目标
- 解决 GreedyNMS 在人群密集、遮挡严重场景中表现不佳的问题,此类场景中多个重叠目标较为常见。
- 克服 GreedyNMS 中固有的精确率-召回率权衡问题,该问题常因过度激进的抑制策略而错误抑制有效检测结果。
- 开发一种后处理方法,在保持计算效率的同时,保留密集目标簇中的多个目标。
- 实现与现有基于学习的检测器(如 Faster R-CNN 和 DPM)的无缝集成,为端到端训练铺平道路。
- 提升在同类目标共现场景下的检测鲁棒性,即同一类别目标严重遮挡时的检测性能。
提出的方法
- Pairwise-NMS 通过使用可学习的成对关系网络,基于 IoU 和特征表示对重叠候选框对进行分类,从而替代 GreedyNMS。
- 当 IoU 低于阈值 $N_t$ 时,正常应用 GreedyNMS;当 IoU 高于 $N_t$ 时,成对关系网络预测两个候选框包含零个、一个或两个目标。
- 成对关系网络采用平衡采样策略进行训练,保持不同类对与相似类对之间 1:3 的比例,以缓解类别不平衡问题。
- 网络采用全局平均池化(GAP)层而非全连接(FC)层,以更好地区分共享一个目标与包含两个独立目标的情况。
- 该方法即插即用,兼容任意检测器架构,可无缝集成至 Faster R-CNN 和 DPM 而无需修改主干网络。
- 网络在 TUD-Crossing 和 MOT15 等数据集的候选框对上进行端到端训练,使用重叠区域的真实标签进行目标数量预测。
实验结果
研究问题
- RQ1可学习的成对关系网络能否在人群密集场景中有效区分包含一个或两个目标的重叠候选框?
- RQ2Pairwise-NMS 在严重遮挡数据集上的平均平均精度(mAP)是否优于 GreedyNMS 和 Soft-NMS?
- RQ3所提出的方法能否在不降低推理速度的前提下,高效集成至 Faster R-CNN 和 DPM 等现有检测器中?
- RQ4网络架构选择(如 GAP 层与 FC 层)如何影响成对关系分类器的性能?
- RQ5何种采样策略能优化在遮挡场景下成对分类任务中不平衡问题的训练精度与泛化能力?
主要发现
- Pairwise-NMS 在 MOT15、TUD-Crossing 和 PETS 数据集上均实现了相对于 GreedyNMS 的一致 mAP 提升,尤其在人群密集和遮挡严重的场景中表现显著。
- 在 TUD-Crossing 数据集上,采用 GAP 层的成对关系网络优于使用 FC 层的版本,实现了更高的验证准确率和更快的收敛速度。
- 该方法减少了误报,并防止在密集场景中漏检,定性对比显示 Pairwise-NMS 比 GreedyNMS 保留了更多有效检测结果。
- 消融实验证实,在训练过程中保持不同类对与相似类对 1:3 的比例,可提升泛化能力并改善目标数量预测性能。
- Pairwise-NMS 保持了与 GreedyNMS 相当的效率,可无缝集成至 Faster R-CNN 和 DPM 检测器中,无需修改网络结构。
- 在密集场景中,该方法优于 Soft-NMS,展现出更强的遮挡鲁棒性,并能更优地处理多个重叠目标。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。