[论文解读] Semantic Head Enhanced Pedestrian Detection in a Crowd
本文提出了一种新型行人检测框架——头部-躯干对齐网络(HBAN),通过利用从躯干边界框推断出的弱监督标注,训练一个并行的语义头部检测器,从而增强对遮挡的鲁棒性。通过引入一种对齐损失,强制头部与躯干预测之间的空间一致性,HBAN在CityPersons数据集上实现了最先进性能,尤其在严重遮挡的行人检测中表现优异,优于现有的基于部件和多分支检测器。
Pedestrian detection in the crowd is a challenging task because of intra-class occlusion. More prior information is needed for the detector to be robust against it. Human head area is naturally a strong cue because of its stable appearance, visibility and relative location to body. Inspired by it, we adopt an extra branch to conduct semantic head detection in parallel with traditional body branch. Instead of manually labeling the head regions, we use weak annotations inferred directly from body boxes, which is named as `semantic head'. In this way, the head detection is formulated into using a special part of labeled box to detect the corresponding part of human body, which surprisingly improves the performance and robustness to occlusion. Moreover, the head-body alignment structure is explicitly explored by introducing Alignment Loss, which functions in a self-supervised manner. Based on these, we propose the head-body alignment net (HBAN) in this work, which aims to enhance pedestrian detection by fully utilizing the human head prior. Comprehensive evaluations are conducted to demonstrate the effectiveness of HBAN on CityPersons dataset.
研究动机与目标
- 解决拥挤场景中行人检测的类内遮挡挑战。
- 利用人类头部作为稳定、可见且具有判别性的线索,以提升检测的鲁棒性。
- 通过从现有躯干框标注中推断头部标注,无需人工标注即可训练语义头部检测器。
- 通过一种新型自监督损失函数(AlignLoss)显式建模头部与躯干的空间对齐关系。
- 证明利用结构先验进行弱监督部件检测可显著提升行人检测性能。
提出的方法
- 引入一个并行检测分支用于检测‘语义头部’(s-head)区域,该区域定义为躯干框的顶部中心部分,其标注通过从躯干边界框推断而来。
- 设计专用的RPN和RCNN头用于s-head检测,在Faster R-CNN框架内与主躯干检测分支端到端联合训练。
- 提出AlignLoss,一种自监督损失,促使预测的躯干框与预测的s-head区域紧密对齐,从而强制实现空间一致性。
- 使用固定长宽比(0.41)和相对位置先验,自动从躯干框生成s-head标注,避免人工标注。
- 应用数据增强技术(如图像放大、色彩失真)以进一步提升泛化能力与性能。
- 采用两阶段检测流程,利用s-head检测结果来优化和稳定躯干框预测,尤其在遮挡场景下表现更优。
实验结果
研究问题
- RQ1弱监督语义头部检测器是否能提升拥挤场景下的行人检测性能?
- RQ2通过可学习损失函数显式强制头部-躯干空间对齐,是否能增强检测对遮挡的鲁棒性?
- RQ3从躯干框中推断出的标注是否足以在无需人工标注的情况下训练出有效的部件检测器?
- RQ4在遮挡行人检测方面,所提方法与最先进基于部件和多分支检测器相比性能如何?
- RQ5语义头部检测的引入是否能改善拥挤行人检测中的非极大值抑制(NMS)效果?
主要发现
- HBAN在CityPersons验证集上达到最先进性能,HOG(R set)mAP为10.9%,HO(R set)mAP为47.0%,优于以往基于部件的方法。
- 在CityPersons测试集上,HBAN在HO任务上达到11.26%的mAP,为所有已发表方法中的最佳结果,展现出对遮挡的卓越鲁棒性。
- HBAN在HO任务上大幅优于RepLoss和Adaptive NMS,表明其在严重遮挡下具有强大的泛化能力。
- 通过图像放大(1.3×),HBAN在R集上mAP提升1.6%,在HO集上提升1.1%,显示出与数据增强技术的强协同效应。
- 尽管仅使用躯干框进行正样本筛选(监督更少),HBAN在R和HO两组上的性能与MGAN相当,并优于Bi-Box。
- 可视化对比显示,HBAN生成的检测框更紧凑、更准确,尤其在躯干严重遮挡时表现更优,且能成功检测到头部,即使躯干完全不可见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。