Skip to main content
QUICK REVIEW

[论文解读] Transformer Based Multi-Grained Features for Unsupervised Person Re-Identification

Jiachen Li, Menglin Wang|arXiv (Cornell University)|Nov 22, 2022
Video Surveillance and Tracking Methods被引用 5
一句话总结

本文提出一种基于Transformer的双分支网络,从视觉Transformer主干网络中提取多粒度特征——全局特征与部件级特征,用于无监督行人重识别。通过在全局特征和部件级特征上结合离线与在线对比学习(采用O2CAP框架),该方法在三个基准数据集上实现了最先进性能,显著缩小了与监督方法之间的差距。

ABSTRACT

Multi-grained features extracted from convolutional neural networks (CNNs) have demonstrated their strong discrimination ability in supervised person re-identification (Re-ID) tasks. Inspired by them, this work investigates the way of extracting multi-grained features from a pure transformer network to address the unsupervised Re-ID problem that is label-free but much more challenging. To this end, we build a dual-branch network architecture based upon a modified Vision Transformer (ViT). The local tokens output in each branch are reshaped and then uniformly partitioned into multiple stripes to generate part-level features, while the global tokens of two branches are averaged to produce a global feature. Further, based upon offline-online associated camera-aware proxies (O2CAP) that is a top-performing unsupervised Re-ID method, we define offline and online contrastive learning losses with respect to both global and part-level features to conduct unsupervised learning. Extensive experiments on three person Re-ID datasets show that the proposed method outperforms state-of-the-art unsupervised methods by a considerable margin, greatly mitigating the gap to supervised counterparts. Code will be available soon at https://github.com/RikoLi/WACV23-workshop-TMGF.

研究动机与目标

  • 解决无监督行人重识别的挑战,即缺乏身份标注但需具备高判别性以实现实际部署。
  • 探索纯Transformer主干网络提取多粒度特征的潜力,受监督Re-ID中基于CNN的多粒度网络启发。
  • 设计双分支架构,从视觉Transformer中并行学习全局与部件级特征,且不修改主干网络。
  • 通过在全局与部件级特征上定义离线与在线对比损失,结合O2CAP框架,增强无监督学习。
  • 通过在无标签设置下有效利用多粒度特征,缩小无监督与监督Re-ID之间的性能差距。

提出的方法

  • 将TransReID-SSL主干网络(一种改进的视觉Transformer,ViT)适配为无监督Re-ID的特征提取主干。
  • 通过复制最后的Transformer层,构建双分支网络,生成每个分支的独立输出,实现并行特征学习。
  • 将每个分支的局部token重塑并均匀划分为多个水平条带,以提取部件级特征。
  • 对两个分支的全局token进行平均,生成单一的全局特征表示。
  • 通过在全局与部件级特征上分别定义离线与在线对比学习损失,集成O2CAP框架,以优化伪标签并提升表征学习。
  • 利用相机感知代理及其关联聚类,引导对比学习过程,无需身份监督。

实验结果

研究问题

  • RQ1在无监督设置下,能否从纯Transformer主干的Re-ID网络中有效提取多粒度特征?
  • RQ2与仅使用全局特征相比,结合全局与部件级对比学习是否能提升无监督行人Re-ID的性能?
  • RQ3在视觉Transformer上采用双分支架构,能否高效捕捉细粒度与长距离上下文线索以用于Re-ID?
  • RQ4基于Transformer的无监督Re-ID模型在多大程度上可缩小与监督方法之间的性能差距?
  • RQ5在多个基准数据集上,该方法在mAP与Rank-1准确率方面与当前最先进无监督Re-ID方法相比表现如何?

主要发现

  • 在MSMT17上,所提方法达到76.8% mAP与92.9% Rank-1,较先前SOTA无监督方法O2CAP在mAP上提升15.8个百分点,在Rank-1上提升11.3个百分点。
  • 在Market-1501上,方法达到89.5% mAP与95.5% Rank-1,与监督方法ABD-Net相比仅以微小差距落后,并超越了多个其他监督方法。
  • 使用真实标签训练的模型在Market-1501上达到91.9% mAP与96.3% Rank-1,表明多粒度特征提取方法极为有效,且与当前最先进监督模型具有竞争力。
  • 在最具挑战性的MSMT17数据集上,性能提升最为显著,相比先前SOTA的Transformer-based无监督方法TransReID-SSL,mAP提升7.6个百分点,Rank-1提升8.3个百分点。
  • 消融实验表明,全局与部件级对比学习损失均对性能有显著贡献,其中部件级监督带来的提升最为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。