Skip to main content
QUICK REVIEW

[论文解读] Segmentation Mask Guided End-to-End Person Search

Dingyuan Zheng, Jimin Xiao|arXiv (Cornell University)|Aug 27, 2019
Video Surveillance and Tracking Methods参考文献 46被引用 4
一句话总结

该论文提出了一种新颖的端到端行人检索框架,利用分割掩码引导特征学习,减轻了行人边界框中背景杂波的负面影响。通过在统一网络中联合优化检测、重识别和分割,该方法在CUHK-SYSU基准上实现了86.3%的mAP和86.5%的top-1准确率,达到当前最先进性能。

ABSTRACT

Person search aims to search for a target person among multiple images recorded by multiple surveillance cameras, which faces various challenges from both pedestrian detection and person re-identification. Besides the large intra-class variations owing to various illumination conditions, occlusions and varying poses, background clutters in the detected pedestrian bounding boxes further deteriorate the extracted features for each person, making them less discriminative. To tackle these problems, we develop a novel approach which guides the network with segmentation masks so that discriminative features can be learned invariant to the background clutters. We demonstrate that joint optimization of pedestrian detection, person re-identification and pedestrian segmentation enables to produce more discriminative features for pedestrian, and consequently leads to better person search performance. Extensive experiments on benchmark dataset CUHK-SYSU, show that our proposed model achieves the state-of-the-art performance with 86.3% mAP and 86.5 top-1 accuracy respectively.

研究动机与目标

  • 解决行人边界框中背景杂波导致特征判别性下降的问题。
  • 克服现有方法将检测、重识别和分割视为独立阶段所带来的局限性。
  • 通过端到端联合优化行人检测、行人重识别和分割,提升行人检索性能。
  • 证明在统一框架中使用部分标注的分割掩码引导特征学习的有效性。
  • 建立一个包含1,833张图像并附带分割掩码的新数据集,以支持所提方法的训练与评估。

提出的方法

  • 在网络中引入并行的掩码分支,利用分割掩码引导特征学习,提升前景特征提取能力。
  • 端到端训练模型,联合优化行人检测、行人重识别和行人分割。
  • 使用16%的训练图像子集(1,833张,共11,206张)的真值分割掩码,监督掩码引导的特征学习。
  • 将分割掩码作为软注意力机制,抑制背景特征并突出具有判别性的身体区域。
  • 采用ResNet-50或ResNet-101作为主干网络进行特征提取,并采用多任务学习策略同时优化所有组件。
  • 应用一种掩码感知的特征聚合模块,将全局图像特征与掩码条件下的局部特征相结合,提升表征鲁棒性。

实验结果

研究问题

  • RQ1分割掩码能否有效用于行人检索中的特征学习,以减轻背景杂波的影响?
  • RQ2检测、重识别和分割的端到端联合优化是否优于分阶段方法?
  • RQ3训练图像中包含分割掩码的比例如何影响最终的行人检索性能?
  • RQ4在遮挡和低分辨率等挑战性条件下,所提方法是否仍能保持优越性能?
  • RQ5该框架在不同规模的图库和真实监控环境下是否具备鲁棒性?

主要发现

  • 所提方法在CUHK-SYSU数据集上达到86.3%的mAP和86.5%的top-1准确率,创下新的最先进性能记录。
  • 在不同图库规模(50至4,000)下性能保持一致优越,表明对规模变化具有鲁棒性。
  • 在低分辨率和遮挡子集上,模型分别取得66.7% mAP和66.8% top-1准确率(低分辨率),以及70.8% mAP和71.3% top-1准确率(遮挡),优于先前方法。
  • 消融实验表明,当12%的训练图像包含分割掩码时,性能显著提升,15%时趋于稳定,16%时达到平台期。
  • 可视化对比显示,与OIM和E2E-PS等基线模型相比,所提模型在复杂背景中更频繁地正确检索目标行人。
  • 将分割掩码作为引导信号可生成更具判别性的特征,定量对比结果也证实了排名性能的提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。