Skip to main content
QUICK REVIEW

[论文解读] V2F-Net: Explicit Decomposition of Occluded Pedestrian Detection

Mingyang Shang, Dawei Xiang|arXiv (Cornell University)|Apr 7, 2021
Video Surveillance and Tracking Methods参考文献 44被引用 5
一句话总结

V2F-Net 提出了一种新颖的两阶段流水线用于遮挡行人检测,通过显式地将任务分解为可见区域检测与完整身体估计,采用可见检测网络(VDN)和完整身体估计网络(FEN)。相较于 FPN 基线,在 CrowdHuman 上实现 5.85% AP 提升,在 CityPersons 上实现 2.24% MR⁻² 改进,且在单阶段与两阶段检测器上均保持一致的性能增益。

ABSTRACT

Occlusion is very challenging in pedestrian detection. In this paper, we propose a simple yet effective method named V2F-Net, which explicitly decomposes occluded pedestrian detection into visible region detection and full body estimation. V2F-Net consists of two sub-networks: Visible region Detection Network (VDN) and Full body Estimation Network (FEN). VDN tries to localize visible regions and FEN estimates full-body box on the basis of the visible box. Moreover, to further improve the estimation of full body, we propose a novel Embedding-based Part-aware Module (EPM). By supervising the visibility for each part, the network is encouraged to extract features with essential part information. We experimentally show the effectiveness of V2F-Net by conducting several experiments on two challenging datasets. V2F-Net achieves 5.85% AP gains on CrowdHuman and 2.24% MR-2 improvements on CityPersons compared to FPN baseline. Besides, the consistent gain on both one-stage and two-stage detector validates the generalizability of our method.

研究动机与目标

  • 解决严重遮挡下行人检测的长期挑战,其中完整身体标注常不完整或具有误导性。
  • 克服端到端完整身体检测的局限性,该方法因完整身体框之间交并比(IoU)过高,导致回归不准确及非极大值抑制(NMS)的错误抑制。
  • 将检测过程分解为两个独立且顺序进行的阶段——先检测可见区域,再估计完整身体,以简化学习过程并提升鲁棒性。
  • 通过引入一种新颖的、零成本的基于嵌入的部件感知模块(EPM),对每个身体部位的可见性进行监督,从而提升完整身体估计的准确性。
  • 在单阶段与两阶段检测器上均验证其泛化能力,确立 V2F-Net 作为遮挡行人检测的强而可复用的基线模型。

提出的方法

  • V2F-Net 由两个子网络构成:用于定位可见行人区域的可见检测网络(VDN),以及从可见框回归完整身体边界框的完整身体估计网络(FEN)。
  • 流水线按顺序处理图像:VDN 检测可见框,对可见框应用非极大值抑制(NMS)(而非完整框),并将保留的框送入 FEN 进行完整身体估计。
  • 引入基于嵌入的部件感知模块(EPM),对每个身体部位的可见性进行监督,以鼓励学习保留结构与比例线索的特征表示,从而提升完整身体估计性能。
  • 训练过程为端到端,VDN 与 FEN 共同优化,使用标准检测损失(如分类与回归损失),而 EPM 额外提供部件级可见性监督。
  • 仅在可见框上应用非极大值抑制(NMS),以防止因完整框重叠导致的错误抑制,从而在必要时保留多个检测结果。
  • 该方法兼容单阶段与两阶段检测器,已在 Faster R-CNN 与 RetinaNet 主干网络上得到验证。

实验结果

研究问题

  • RQ1将遮挡行人检测分解为可见区域检测与完整身体估计,是否能相比端到端完整身体检测带来性能提升?
  • RQ2使用可见框作为中间监督,是否能降低完整身体回归的学习难度,并缓解 NMS 带来的错误抑制?
  • RQ3一种对每个身体部位可见性进行监督的部件感知模块,是否能提升遮挡条件下的完整身体估计准确性?
  • RQ4所提出的流水线在不同检测器架构(单阶段 vs. 两阶段)上的泛化能力如何?
  • RQ5各个组件(VDN、FEN、EPM)对整体性能提升的贡献分别是什么?各自的局限性又是什么?

主要发现

  • 与 FPN 基线相比,V2F-Net 在 CrowdHuman 上实现 5.85% 的 AP 提升,在 CityPersons 上实现 2.24% 的 MR⁻² 改进,表明在两个主流遮挡行人检测基准上均取得显著性能增益。
  • 性能增益在单阶段与两阶段检测器上均保持一致,验证了 V2F-Net 流水线的泛化能力。
  • 消融实验表明,P-VDN+NMS(完美可见检测配合 NMS)在 CrowdHuman 上达到 95.14% AP 与 17.67% MR⁻²,表明对可见框应用 NMS 显著减少了错误抑制。
  • P-FEN 实验(完美完整身体估计)仅带来微小的 AP 提升(92.25% vs. 91.03%),但 MR⁻² 显著下降(35.56% 降至 20.52%),表明 VDN 的高置信度误检是主要瓶颈。
  • EPM 模块在不增加推理成本的前提下提升了性能,因其为轻量化可学习模块,能增强完整身体估计的特征表示。
  • 该方法在 CityPersons 上优于或匹配当前最优方法,达到 96.19% AP 与 10.08% MR⁻²,完整 V2F-Net 模型甚至超越了更复杂的基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。