Skip to main content
QUICK REVIEW

[论文解读] Clothes-Changing Person Re-identification with RGB Modality Only

Xinqian Gu, Hong Chang|arXiv (Cornell University)|Apr 14, 2022
Video Surveillance and Tracking Methods被引用 12
一句话总结

本文提出了一种基于服装的对抗性损失(CAL),这是一种新颖的损失函数,通过强制模型学习与服装无关的特征(如面部、发型和体型)来提升仅使用RGB图像在换装条件下的行人重识别性能。通过将服装分类建模为多正类问题,CAL增强了特征解缠,无需多模态输入或复杂架构即可在基准数据集上实现最先进性能。

ABSTRACT

The key to address clothes-changing person re-identification (re-id) is to extract clothes-irrelevant features, e.g., face, hairstyle, body shape, and gait. Most current works mainly focus on modeling body shape from multi-modality information (e.g., silhouettes and sketches), but do not make full use of the clothes-irrelevant information in the original RGB images. In this paper, we propose a Clothes-based Adversarial Loss (CAL) to mine clothes-irrelevant features from the original RGB images by penalizing the predictive power of re-id model w.r.t. clothes. Extensive experiments demonstrate that using RGB images only, CAL outperforms all state-of-the-art methods on widely-used clothes-changing person re-id benchmarks. Besides, compared with images, videos contain richer appearance and additional temporal information, which can be used to model proper spatiotemporal patterns to assist clothes-changing re-id. Since there is no publicly available clothes-changing video re-id dataset, we contribute a new dataset named CCVID and show that there exists much room for improvement in modeling spatiotemporal information. The code and new dataset are available at: https://github.com/guxinqian/Simple-CCReID.

研究动机与目标

  • 为解决在长期监控中个体换装这一常见问题下的行人重识别挑战。
  • 通过显式挖掘与服装无关的属性(如面部、发型和体型)来提升仅从RGB图像中学习特征的能力。
  • 消除对多模态输入(如轮廓图、三维形状)或复杂解缠模型的依赖。
  • 开发一个新的基于视频的基准数据集CCVID,以支持未来在换装重识别中的时空建模研究。

提出的方法

  • 提出一种基于服装的对抗性损失(CAL),将同一身份的所有服装变体视为多正类分类设置中的正类。
  • 在重识别主干网络上引入一个服装分类头,通过交叉熵损失进行训练以预测服装类别。
  • 使用反向传播惩罚模型对服装的预测能力,促使主干网络学习对服装变化不变的特征。
  • 在训练过程中应用该损失,以优化特征图,使其更强调体型、发型和面部特征,而非服装图案。
  • 在基于图像的基准数据集(LTCC、VC-Clothes、LaST、DeepChange)上验证该方法,并引入一个新的视频数据集CCVID用于时空分析。
  • 在DeepChange数据集中使用采集日期作为伪服装标签,以证明在无真实服装标注的情况下仍具鲁棒性。

实验结果

研究问题

  • RQ1仅基于RGB图像训练的损失函数能否在不依赖多模态输入的情况下有效提取与服装无关的特征?
  • RQ2CAL中的多正类分类如何改善身份相关特征与服装变化之间的解缠?
  • RQ3仅使用RGB图像的模型在换装重识别任务中,能在多大程度上超越多模态或基于解缠的最先进方法?
  • RQ4该方法在视频数据上的表现如何?时间信息在提升性能方面起到何种作用?
  • RQ5该方法能否在无真实服装标注的数据集中泛化,仅使用采集日期等元数据作为伪标签?

主要发现

  • 在LTCC基准上,CAL在相同服装和换装设置下分别达到92.9%的top-1准确率和87.2%的mAP,优于基线模型和所有最先进方法。
  • 在VC-Clothes上,CAL在通用设置下达到92.9%的top-1和87.2%的mAP,在换装(CC)设置下达到81.4%的top-1和81.7%的mAP,优于多模态方法如3DSL和FSAM。
  • 在LaST上,CAL达到73.7%的top-1和28.8%的mAP,超过基线(69.4% top-1,25.6% mAP)以及最先进方法如BoT和mAPLoss。
  • 在DeepChange上,使用采集日期作为伪服装标签,CAL达到54.0%的top-1和19.0%的mAP,显著优于基线(50.6% top-1,15.9% mAP)。
  • 收敛性分析表明,CAL成功将正类服装预测推向约0.6–1.0,伪正类预测推向约1e-4–0.1,负类预测推向约1e-5–1e-2,验证了预期的优化行为。
  • 新引入的CCVID数据集揭示了在建模时空模式方面仍有巨大提升空间,凸显了基于视频的重识别在换装场景中的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。