[论文解读] Transformer Based Multi-Grained Features for Unsupervised Person Re-Identification
本文提出一种基于Transformer的双分支网络,从视觉Transformer主干网络中提取多粒度特征——全局特征与部件级特征,用于无监督行人重识别。通过在全局特征和部件级特征上结合离线与在线对比学习(采用O2CAP框架),该方法在三个基准数据集上实现了最先进性能,显著缩小了与监督方法之间的差距。
Multi-grained features extracted from convolutional neural networks (CNNs) have demonstrated their strong discrimination ability in supervised person re-identification (Re-ID) tasks. Inspired by them, this work investigates the way of extracting multi-grained features from a pure transformer network to address the unsupervised Re-ID problem that is label-free but much more challenging. To this end, we build a dual-branch network architecture based upon a modified Vision Transformer (ViT). The local tokens output in each branch are reshaped and then uniformly partitioned into multiple stripes to generate part-level features, while the global tokens of two branches are averaged to produce a global feature. Further, based upon offline-online associated camera-aware proxies (O2CAP) that is a top-performing unsupervised Re-ID method, we define offline and online contrastive learning losses with respect to both global and part-level features to conduct unsupervised learning. Extensive experiments on three person Re-ID datasets show that the proposed method outperforms state-of-the-art unsupervised methods by a considerable margin, greatly mitigating the gap to supervised counterparts. Code will be available soon at https://github.com/RikoLi/WACV23-workshop-TMGF.
研究动机与目标
- 解决无监督行人重识别的挑战,即缺乏身份标注但需具备高判别性以实现实际部署。
- 探索纯Transformer主干网络提取多粒度特征的潜力,受监督Re-ID中基于CNN的多粒度网络启发。
- 设计双分支架构,从视觉Transformer中并行学习全局与部件级特征,且不修改主干网络。
- 通过在全局与部件级特征上定义离线与在线对比损失,结合O2CAP框架,增强无监督学习。
- 通过在无标签设置下有效利用多粒度特征,缩小无监督与监督Re-ID之间的性能差距。
提出的方法
- 将TransReID-SSL主干网络(一种改进的视觉Transformer,ViT)适配为无监督Re-ID的特征提取主干。
- 通过复制最后的Transformer层,构建双分支网络,生成每个分支的独立输出,实现并行特征学习。
- 将每个分支的局部token重塑并均匀划分为多个水平条带,以提取部件级特征。
- 对两个分支的全局token进行平均,生成单一的全局特征表示。
- 通过在全局与部件级特征上分别定义离线与在线对比学习损失,集成O2CAP框架,以优化伪标签并提升表征学习。
- 利用相机感知代理及其关联聚类,引导对比学习过程,无需身份监督。
实验结果
研究问题
- RQ1在无监督设置下,能否从纯Transformer主干的Re-ID网络中有效提取多粒度特征?
- RQ2与仅使用全局特征相比,结合全局与部件级对比学习是否能提升无监督行人Re-ID的性能?
- RQ3在视觉Transformer上采用双分支架构,能否高效捕捉细粒度与长距离上下文线索以用于Re-ID?
- RQ4基于Transformer的无监督Re-ID模型在多大程度上可缩小与监督方法之间的性能差距?
- RQ5在多个基准数据集上,该方法在mAP与Rank-1准确率方面与当前最先进无监督Re-ID方法相比表现如何?
主要发现
- 在MSMT17上,所提方法达到76.8% mAP与92.9% Rank-1,较先前SOTA无监督方法O2CAP在mAP上提升15.8个百分点,在Rank-1上提升11.3个百分点。
- 在Market-1501上,方法达到89.5% mAP与95.5% Rank-1,与监督方法ABD-Net相比仅以微小差距落后,并超越了多个其他监督方法。
- 使用真实标签训练的模型在Market-1501上达到91.9% mAP与96.3% Rank-1,表明多粒度特征提取方法极为有效,且与当前最先进监督模型具有竞争力。
- 在最具挑战性的MSMT17数据集上,性能提升最为显著,相比先前SOTA的Transformer-based无监督方法TransReID-SSL,mAP提升7.6个百分点,Rank-1提升8.3个百分点。
- 消融实验表明,全局与部件级对比学习损失均对性能有显著贡献,其中部件级监督带来的提升最为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。