Skip to main content
QUICK REVIEW

[论文解读] Prototypical Contrastive Learning-based CLIP Fine-tuning for Object Re-identification

Jiachen Li, Xiaojin Gong|arXiv (Cornell University)|Oct 26, 2023
Advanced Neural Network Applications被引用 5
一句话总结

本文提出了一种基于原型对比学习(PCL)的CLIP微调方法,用于在监督和无监督设置下提升目标重识别(Re-ID)性能,通过直接微调CLIP的图像编码器并使用PCL损失,消除了提示学习的需求。该方法在无监督Re-ID中表现优异,尤其结合O2CAP损失和冻结补丁投影层技巧时,性能媲美CLIP-ReID并达到当前最先进水平。

ABSTRACT

This work aims to adapt large-scale pre-trained vision-language models, such as contrastive language-image pretraining (CLIP), to enhance the performance of object reidentification (Re-ID) across various supervision settings. Although prompt learning has enabled a recent work named CLIP-ReID to achieve promising performance, the underlying mechanisms and the necessity of prompt learning remain unclear due to the absence of semantic labels in ReID tasks. In this work, we first analyze the role prompt learning in CLIP-ReID and identify its limitations. Based on our investigations, we propose a simple yet effective approach to adapt CLIP for supervised object Re-ID. Our approach directly fine-tunes the image encoder of CLIP using a prototypical contrastive learning (PCL) loss, eliminating the need for prompt learning. Experimental results on both person and vehicle Re-ID datasets demonstrate the competitiveness of our method compared to CLIP-ReID. Furthermore, we extend our PCL-based CLIP fine-tuning approach to unsupervised scenarios, where we achieve state-of-the art performance. Code is available at https://github.com/RikoLi/PCL-CLIP.

研究动机与目标

  • 探究在Re-ID任务中缺乏语义类别名称时,CLIP-ReID中提示学习的内在机制。
  • 解决因缺乏语义标签导致的提示学习在Re-ID中的局限性,避免文本与视觉特征之间的潜在错位。
  • 提出一种更简单、高效的提示学习替代方案,通过使用原型对比学习(PCL)损失直接微调CLIP的图像编码器。
  • 将基于PCL的微调方法扩展至无监督Re-ID,其中采用伪标签和迭代聚类技术。
  • 通过结合CLIP预训练特征、PCL损失以及冻结补丁投影层技巧,在无监督Re-ID中实现最先进性能。

提出的方法

  • 该方法用原型对比学习(PCL)损失替代提示学习,该损失在微调过程中使用每个ID的最新视觉特征中心。
  • PCL损失通过将同一ID的特征拉近至其对应的视觉中心,直接优化图像编码器,避免使用过时或错位的文本提示。
  • 在监督Re-ID中,该方法使用单一PCL损失,或与ID损失结合,以提升在MSMT17和Market1501上的性能。
  • 在无监督Re-ID中,基于PCL的微调被整合进基于聚类的框架(如CC、CAP、O2CAP),将其中的主干网络替换为CLIP的图像编码器。
  • 为在无监督设置中稳定训练,冻结CLIP视觉Transformer的补丁投影层,防止微调过程中的发散。
  • 该方法在包括Market1501、MSMT17和VeRi-776在内的行人与车辆Re-ID基准上进行评估,涵盖监督与无监督两种设置。

实验结果

研究问题

  • RQ1当类别名称在Re-ID中语义无意义时,提示学习在CLIP-ReID中的真实作用机制是什么?
  • RQ2是否能通过PCL损失有效替代Re-ID中的提示学习,且无需依赖文本提示?
  • RQ3在监督Re-ID中,使用PCL损失直接微调CLIP图像编码器是否优于CLIP-ReID?
  • RQ4基于PCL的微调方法能否成功扩展至采用伪标签的无监督Re-ID?
  • RQ5在无监督Re-ID中微调CLIP视觉Transformer时,需要哪些训练稳定化技术?

主要发现

  • 在监督Re-ID中,PCL-CLIP仅使用PCL损失即在Market1501上达到81.1%的rank-1准确率,在MSMT17上达到97.0%,性能与CLIP-ReID相当。
  • 当与ID损失结合时,PCL-CLIP在MSMT17上达到82.5%的rank-1准确率,虽略低于CLIP-ReID的83.3%,但训练流程更简单。
  • 在无监督Re-ID中,PCL-CLIP结合O2CAP损失在MSMT17上达到45.5%的rank-1准确率,超越此前SOTA的41.9%(O2CAP)和41.0%(CAP)。
  • 在无监督Re-ID中,PCL-CLIP结合O2CAP损失在VeRi-776上达到95.0%的rank-1准确率,显著优于此前SOTA方法。
  • 冻结补丁投影层技巧能有效稳定无监督训练,实现收敛并提升性能,优于基线CLIP微调。
  • t-SNE可视化结果表明,PCL仅使用视觉中心即可学习到高质量、判别性强的特征空间,验证了其在无文本提示下的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。