Skip to main content
QUICK REVIEW

[论文解读] Joint Generative and Contrastive Learning for Unsupervised Person Re-identification

Chen, Hao, Wang, Yaohui|arXiv (Cornell University)|Dec 16, 2020
Video Surveillance and Tracking Methods参考文献 51被引用 10
一句话总结

本文提出了一种用于无监督行人重识别的联合生成与对比学习框架,采用基于3D网格的生成对抗网络(GAN)在无需标注源数据集的情况下生成多样化的全新视角。通过解耦身份特征与结构特征,该方法通过生成与对比学习之间的相互优化,增强了视角不变表示学习,在完全无监督和领域自适应设置下的多个ReID基准上实现了最先进性能。

ABSTRACT

Recent self-supervised contrastive learning provides an effective approach for unsupervised person re-identification (ReID) by learning invariance from different views (transformed versions) of an input. In this paper, we incorporate a Generative Adversarial Network (GAN) and a contrastive learning module into one joint training framework. While the GAN provides online data augmentation for contrastive learning, the contrastive module learns view-invariant features for generation. In this context, we propose a mesh-based view generator. Specifically, mesh projections serve as references towards generating novel views of a person. In addition, we propose a view-invariant loss to facilitate contrastive learning between original and generated views. Deviating from previous GAN-based unsupervised ReID methods involving domain adaptation, we do not rely on a labeled source dataset, which makes our method more flexible. Extensive experimental results show that our method significantly outperforms state-of-the-art methods under both, fully unsupervised and unsupervised domain adaptive settings on several large scale ReID datsets.

研究动机与目标

  • 解决传统自监督对比学习依赖简单数据增强技术、视角多样性有限的局限性。
  • 消除基于GAN的无监督ReID中对标注源数据集的依赖,该依赖在领域自适应方法中普遍存在。
  • 通过使用3D网格解耦生成真实且多样的新视角,提升无监督行人重识别中特征的鲁棒性。
  • 通过共享的身份特征学习,实现生成模块与对比模块之间的相互优化。

提出的方法

  • 引入一种基于3D网格的视角生成器,从无标注图像中估计身体形状与姿态,通过网格旋转实现结构化视角合成。
  • 该方法对身份特征(颜色、身体形状)与结构特征(姿态、视角)进行解耦,以实现可控的图像生成。
  • 设计了一种视角不变对比损失,以最大化同一人原始视角与生成视角之间的表示相似性,同时最小化不同身份之间的相似性。
  • 生成与对比模块通过共享的身份特征编码器进行联合训练,实现相互优化。
  • 该框架在完全无监督和无监督领域自适应设置下均能运行,并在两种设置下均取得性能提升。
  • 使用Fréchet Inception Distance(FID)和结构相似性(SSIM)评估生成质量,其中SSIM更强调结构多样性。

实验结果

研究问题

  • RQ1基于3D网格的GAN是否能够在不依赖标注源数据的情况下,为无监督行人ReID生成多样且身份保持的新视角?
  • RQ2与单独训练相比,生成与对比模块的联合训练是否能提升特征表示质量?
  • RQ3在完全无监督设置下,身份特征与结构特征是否能有效解耦,以实现可控的图像生成?
  • RQ4所提出的视角不变损失如何增强对比学习中视角不变表示的学习?
  • RQ5与基于骨骼引导或标准数据增强的方法相比,基于网格的生成在生成质量与ReID性能方面有何影响?

主要发现

  • 所提方法在Market-1501、DukeMTMC-ReID和MSMT17上,在完全无监督和无监督领域自适应设置下均达到最先进性能。
  • 在完全无监督设置下的Market-1501上,该方法实现了78.6%的rank-1准确率和62.3%的mAP,优于先前最先进方法。
  • 在Market-1501上,该方法的Fréchet Inception Distance(FID)为59.86,SSIM为0.367,表明生成图像具有高真实感和结构多样性。
  • 消融实验表明,视角不变损失显著提升了表示学习,相比基线对比学习,mAP提升了4.2%。
  • 定性结果表明,身份特征与结构特征被有效解耦:仅改变结构特征可保持外观不变,反之亦然。
  • 尽管FID略高,该方法在SSIM上优于DG-Net(0.367 vs. 0.360),表明其生成视角具有更好的结构多样性和更少伪影。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。