Skip to main content
QUICK REVIEW

[论文解读] Person re-identification with fusion of hand-crafted and deep pose-based body region features

Jubin Johnson, Shunsuke Yasugi|arXiv (Cornell University)|Mar 27, 2018
Video Surveillance and Tracking Methods参考文献 1被引用 10
一句话总结

该论文提出了一种行人重识别方法,通过融合手工设计的特征(LOMO)与基于姿态引导的局部身体区域(头部、躯干和腿部)的深度特征,结合全局特征主干网络。通过利用姿态估计对齐局部特征,并在判别性子空间上应用度量学习,该方法在四个基准数据集上实现了最先进性能,显著提升了对未见身份的零样本泛化能力。

ABSTRACT

Person re-identification (re-ID) aims to accurately re- trieve a person from a large-scale database of images cap- tured across multiple cameras. Existing works learn deep representations using a large training subset of unique per- sons. However, identifying unseen persons is critical for a good re-ID algorithm. Moreover, the misalignment be- tween person crops to detection errors or pose variations leads to poor feature matching. In this work, we present a fusion of handcrafted features and deep feature representa- tion learned using multiple body parts to complement the global body features that achieves high performance on un- seen test images. Pose information is used to detect body regions that are passed through Convolutional Neural Net- works (CNN) to guide feature learning. Finally, a metric learning step enables robust distance matching on a dis- criminative subspace. Experimental results on 4 popular re-ID benchmark datasets namely VIPer, DukeMTMC-reID, Market-1501 and CUHK03 show that the proposed method achieves state-of-the-art performance in image-based per- son re-identification.

研究动机与目标

  • 解决零样本学习场景下对未见身份的行人重识别挑战。
  • 缓解姿态变化、检测误差和行人图像裁剪错位导致的性能下降问题。
  • 通过融合全局深度特征与来自头部、躯干和腿部区域的局部化、姿态引导特征,提升特征表示能力。
  • 通过结合互补的手工设计特征(LOMO)与深度特征并应用度量学习,提升跨域泛化能力。
  • 证明粗粒度身体部位(头部、躯干、腿部)在特征融合中优于细粒度微区域。

提出的方法

  • 利用姿态估计检测并裁剪关键身体区域(头部、躯干、腿部),以指导局部特征学习。
  • 使用深度卷积神经网络主干网络(Inception或ResNet-50)从每个身体区域和全局图像中提取特征。
  • 将三个身体区域的特征与全局图像的特征拼接,形成统一的表示。
  • 将手工设计的LOMO特征与深度特征融合,以增强判别能力。
  • 应用度量学习步骤(XQDA)以学习判别性子空间,提升距离匹配性能。
  • 框架采用分离训练策略,结合深度学习与手工设计特征的优势。

实验结果

研究问题

  • RQ1将手工设计特征与基于姿态引导的身体区域深度特征融合,是否能提升对未见身份的行人重识别性能?
  • RQ2身体区域粒度选择(宏观 vs. 微观)如何影响行人重识别中特征融合的性能?
  • RQ3基于姿态引导的身体部位定位是否能降低姿态变化和检测误差对特征匹配的影响?
  • RQ4全局特征与局部特征的结合是否能在存在领域偏移的数据集上实现更好的泛化能力?
  • RQ5所提出的融合策略在mAP和Rank-1准确率方面与最先进方法相比如何?

主要发现

  • 所提方法在Market-1501数据集上达到88.3%的Rank-1准确率和69.5%的mAP,优于全局特征和SpindleNet的细粒度融合方法。
  • 在VIPeR数据集上,加入LOMO和XQDA后,性能提升至91.1% mAP和63.3% Rank-1,超越所有基线方法。
  • 仅使用三个宏观身体区域(头部、躯干、腿部)的性能优于使用七个微区域,mAP和Rank-1较全局特征分别提升2%。
  • 在DukeMTMC-reID数据集上,该方法达到83.5% mAP和66.1% Rank-1的最先进性能,使用所提出的融合框架。
  • 定性结果表明,即使在严重姿态变化、遮挡和单次样本设置下,检索仍具鲁棒性,尤其在VIPeR和CUHK03数据集上表现突出。
  • ResNet-50在此设置下并未优于Inception,表明更深网络不必然带来更好的行人重识别泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。