[论文解读] SiCL: Silhouette-Driven Contrastive Learning for Unsupervised Person Re-Identification with Clothes Change
本文提出MaskCL,一种新颖的无监督对比学习框架,用于在衣物更换条件下进行长时序行人重识别,利用行人轮廓掩码作为语义提示,学习跨衣物不变的特征。通过从RGB特征和掩码特征构建分层语义邻居结构,MaskCL显著优于无监督基线方法,并在五个基准数据集上缩小了与监督SOTA方法的差距。
In this paper, we address a highly challenging yet critical task: unsupervised long-term person re-identification with clothes change. Existing unsupervised person re-id methods are mainly designed for short-term scenarios and usually rely on RGB cues so that fail to perceive feature patterns that are independent of the clothes. To crack this bottleneck, we propose a silhouette-driven contrastive learning (SiCL) method, which is designed to learn cross-clothes invariance by integrating both the RGB cues and the silhouette information within a contrastive learning framework. To our knowledge, this is the first tailor-made framework for unsupervised long-term clothes change eid{}, with superior performance on six benchmark datasets. We conduct extensive experiments to evaluate our proposed SiCL compared to the state-of-the-art unsupervised person reid methods across all the representative datasets. Experimental results demonstrate that our proposed SiCL significantly outperforms other unsupervised re-id methods.
研究动机与目标
- 为解决在衣物更换条件下缺乏无监督长时序行人重识别方法的问题,该场景虽具现实意义但研究尚不充分。
- 克服传统无监督方法仅依赖RGB特征并基于衣物颜色聚类所导致的错误传播问题。
- 通过在对比学习中整合轮廓掩码作为语义提示,学习与衣物无关、跨衣物不变的特征。
- 通过在五个数据集上进行广泛评估,建立无监督长时序行人重识别在衣物更换条件下的基准。
提出的方法
- MaskCL采用双分支网络提取RGB特征和轮廓掩码特征,实现外观与语义结构的联合学习。
- 利用轮廓掩码作为语义提示,引导对比学习,提升对衣物变化的不变性。
- 构建分层语义邻居结构:通过RGB特征进行实例级聚类,并利用RGB与掩码特征的组合进行聚类级邻居发现。
- 模型使用对比损失进行训练,鼓励正样本对(同一身份)在特征空间中彼此靠近,同时由掩码特征提供的语义邻居引导学习过程。
- 框架采用基于语义邻居集的邻居采样策略,以提升不同衣物外观下的特征对齐效果。
- 该方法采用端到端训练,以对比目标函数为基础,结合RGB特征与基于掩码的语义线索,最小化因衣物变化导致的特征差异。

实验结果
研究问题
- RQ1无监督行人重识别模型能否在存在显著衣物变化的长时序场景中实现良好泛化?
- RQ2轮廓掩码能否作为有效的语义提示,引导对比学习并提升跨衣物不变性?
- RQ3结合RGB与掩码特征的分层语义邻居结构,是否能带来优于仅使用RGB聚类的特征学习效果?
- RQ4提取的轮廓掩码质量如何影响模型在低质量与高质量数据集上的性能表现?
- RQ5无监督方法能否在真实世界、非约束条件下的衣物更换基准上实现接近监督SOTA的性能?
主要发现
- 在VC-Clothes数据集上,MaskCL取得61.7% mAP和71.7% R-1,较次优的无监督方法在mAP上提升超过2个百分点。
- 在具有挑战性的Deepchange基准上,MaskCL使用ResNet-50取得11.8% mAP和39.7% R-1,超越无监督SOTA方法SpCL(8.90% mAP)。
- 在Deepchange数据集上,MaskCL使用ViT-B16取得14.9% mAP,与监督ViT-B16的14.9% mAP相当,显著缩小了与监督SOTA的性能差距。
- 在VC-Clothes上,仅使用掩码特征(不使用RGB)即取得最佳结果(63.4% mAP),表明高质量掩码包含丰富的不变信息。
- 可视化结果表明,与CACL相比,MaskCL产生更精确的匹配,因颜色相似性导致的错误匹配更少。
- 在训练过程中,语义邻居集中正确身份样本的比例持续上升,证实了特征对齐与聚类一致性的提升。
![Figure 2: Visualizing the intrinsic challenges in long-term person re-id with clothes change. We randomly selected $28$ images of a single individual from the Deepchange [ 48 ] dataset. It is clear that the differences in appearance across different clothes (rows) are much more significant than that](https://ar5iv.labs.arxiv.org/html/2305.13600/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。