[论文解读] Identity-Seeking Self-Supervised Representation Learning for Generalizable Person Re-identification
本论文提出身份追寻自监督表征学习(ISR),一种从4780万张未标注视频帧中学习领域泛化性行人重识别表征的方法,无需任何人工标注。通过将帧间身份关联建模为最大权重二分图匹配问题,并采用可靠性引导的对比损失,ISR在零样本领域泛化设置下达到最先进性能,在Market-1501上取得87.0% Rank-1,在MSMT17上取得56.4%,分别优于监督方法5.0%和19.5%。
This paper aims to learn a domain-generalizable (DG) person re-identification (ReID) representation from large-scale videos extbf{without any annotation}. Prior DG ReID methods employ limited labeled data for training due to the high cost of annotation, which restricts further advances. To overcome the barriers of data and annotation, we propose to utilize large-scale unsupervised data for training. The key issue lies in how to mine identity information. To this end, we propose an Identity-seeking Self-supervised Representation learning (ISR) method. ISR constructs positive pairs from inter-frame images by modeling the instance association as a maximum-weight bipartite matching problem. A reliability-guided contrastive loss is further presented to suppress the adverse impact of noisy positive pairs, ensuring that reliable positive pairs dominate the learning process. The training cost of ISR scales approximately linearly with the data size, making it feasible to utilize large-scale data for training. The learned representation exhibits superior generalization ability. extbf{Without human annotation and fine-tuning, ISR achieves 87.0\% Rank-1 on Market-1501 and 56.4\% Rank-1 on MSMT17}, outperforming the best supervised domain-generalizable method by 5.0\% and 19.5\%, respectively. In the pre-training$ ightarrow$fine-tuning scenario, ISR achieves state-of-the-art performance, with 88.4\% Rank-1 on MSMT17. The code is at \url{https://github.com/dcp15/ISR_ICCV2023_Oral}.
研究动机与目标
- 在不依赖人工标注数据的前提下,学习领域泛化性行人重识别表征。
- 克服现有领域泛化ReID方法因高标注成本而依赖小规模标注数据集的局限性。
- 利用大规模无监督视频数据进行训练,充分利用互联网视频中呈现的多样性领域。
- 实现在未见领域中无需微调的零样本ReID模型部署。
- 开发一种可扩展的自监督方法,学习身份判别而非实例判别。
提出的方法
- 将帧间实例关联建模为最大权重二分图匹配问题,从视频帧中挖掘身份正样本对。
- 基于帧之间的最优匹配构建正样本对,确保同一身份的图像被归为一组。
- 提出一种可靠性引导的对比损失,降低噪声正样本对的权重,优先利用可靠样本进行训练。
- 使用记忆库存储负样本特征,并应用对比损失,促使不同身份之间的特征实现分离。
- 采用双分支主干网络(如ResNet50或Swin-Transformer)从同一人的不同增强视图中提取特征。
- 可随数据规模线性扩展,支持在最大达4780万张图像的大规模视频数据集上高效训练。
实验结果
研究问题
- RQ1从大规模无标注视频中进行自监督表征学习,是否能在无需任何人工标注的情况下实现最先进的领域泛化性行人重识别性能?
- RQ2在缺乏身份标签的情况下,仅使用视频帧序列,如何有效学习身份判别?
- RQ3噪声正样本对对表征学习有何影响,其负面影响如何缓解?
- RQ4随着无标注训练数据量的增加,模型性能是否持续提升?
- RQ5所提出的可靠性引导对比损失与标准焦点损失相比,在处理自监督学习中的噪声监督时表现如何?
主要发现
- 在零样本领域泛化设置下,ISR在Market-1501上达到87.0% Rank-1,在MSMT17上达到56.4% Rank-1,分别优于最佳监督方法5.0%和19.5%。
- 采用Swin-Transformer主干网络时,ISR在MSMT17上达到56.4% Rank-1和30.3% mAP,表明其在更大模型下具有强大的可扩展性。
- 在预训练→微调设置下,ISR在MSMT17上达到88.4% Rank-1,创下新的最先进水平。
- 在Market-1501和MSMT17上的性能随着训练数据量的增加持续提升,即使在4.096亿张图像时仍未出现饱和。
- 可靠性引导对比损失显著优于焦点损失,证实从可靠样本引导学习比加权困难样本更有效。
- t-SNE可视化结果表明,ISR学习到的是身份判别性特征,同一身份的图像紧密聚集,而MoCo则学习到实例判别性特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。