Skip to main content
QUICK REVIEW

[论文解读] PCN: Part and Context Information for Pedestrian Detection with CNNs

Shiguang Wang, Jian Cheng|arXiv (Cornell University)|Apr 12, 2018
Video Surveillance and Tracking Methods参考文献 27被引用 10
一句话总结

该论文提出PCN,一种基于CNN的新型行人检测框架,通过LSTM实现基于部件的语义通信,并利用局部竞争机制(Maxout)实现自适应多尺度上下文建模。通过融合部件分支与上下文分支的特征,PCN在Caltech数据集上实现了SOTA性能,对部分遮挡行人的漏检率为16.4%,对严重遮挡行人的漏检率为56.7%,显著提升了遮挡条件下的检测鲁棒性。

ABSTRACT

Pedestrian detection has achieved great improvements in recent years, while complex occlusion handling is still one of the most important problems. To take advantage of the body parts and context information for pedestrian detection, we propose the part and context network (PCN) in this work. PCN specially utilizes two branches which detect the pedestrians through body parts semantic and context information, respectively. In the Part Branch, the semantic information of body parts can communicate with each other via recurrent neural networks. In the Context Branch, we adopt a local competition mechanism for adaptive context scale selection. By combining the outputs of all branches, we develop a strong complementary pedestrian detector with a lower miss rate and better localization accuracy, especially for occlusion pedestrian. Comprehensive evaluations on two challenging pedestrian detection datasets (i.e. Caltech and INRIA) well demonstrated the effectiveness of the proposed PCN.

研究动机与目标

  • 为解决复杂遮挡条件下行人检测的长期挑战,特别是当身体部位被遮挡时。
  • 通过循环建模实现身体部件间的语义通信,提升检测精度。
  • 利用可学习的局部竞争机制,自适应地为不同行人实例选择最优上下文尺度。
  • 将部件与上下文信息整合到统一的互补检测框架中,以提升定位精度并降低漏检率。

提出的方法

  • PCN框架包含三个分支:基础检测器、部件分支和上下文分支,三者共享一个共同的主干特征提取器。
  • 在部件分支中,行人边界框被划分为多个部件网格,每个网格具有检测得分;LSTM层实现部件之间的双向语义通信,以优化得分。
  • 上下文分支采用基于Maxout的局部竞争机制,自适应地在多个尺度(如1.5倍、1.8倍、2.1倍行人尺寸)中选择最具信息量的上下文区域。
  • 将部件分支与上下文分支的输出与基础检测器的输出进行融合,生成最终更鲁棒的检测得分。
  • 通过联合训练多任务损失函数(包含分类、定位和部件检测目标)实现端到端训练。
  • LSTM的使用使网络能够建模可见与被遮挡身体部件之间的长距离依赖关系,从而提升对部分可见行人的识别能力。

实验结果

研究问题

  • RQ1对身体部件语义的循环建模能否提升遮挡行人的检测性能?
  • RQ2自适应、数据驱动的上下文尺度选择是否优于行人检测中的固定尺度上下文提取?
  • RQ3部件特征与上下文特征的融合能否显著降低漏检率,尤其是在严重遮挡情况下?
  • RQ4所提出的PCN框架是否在处理部分遮挡与完全遮挡场景时,优于现有SOTA方法?

主要发现

  • 在Caltech数据集的'Occ.partial'子集上,PCN实现了16.4%的漏检率,相比基线RPN+FRCNN opt模型(24.0%)相对提升了7.6%。
  • 在'Occ.heavy'子集上,PCN将漏检率降低至56.7%,相比基线模型(64.9%)相对提升了10.2%。
  • 完整PCN模型在Caltech的'Reasonable'划分上实现了9.0%的漏检率,优于最佳单尺度上下文模型(x=2.1时为9.6%)和基线模型(12.1%)。
  • 消融实验表明,基于LSTM的部件通信将'Occ.heavy'行人的漏检率从64.6%降至58.9%,证明其在遮挡处理中的有效性。
  • 采用Maxout的上下文分支实现了9.0%的漏检率,优于所有单尺度上下文模型(9.6%–9.9%),证明了自适应尺度选择的优势。
  • 可视化对比显示,与DeepParts和RPN+BF相比,PCN能检测到更多遮挡行人,且定位精度更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。