Skip to main content
QUICK REVIEW

[论文解读] Rethinking Person Re-Identification via Semantic-Based Pretraining

Suncheng Xiang, Gao, Jingsheng|arXiv (Cornell University)|Oct 11, 2021
Video Surveillance and Tracking Methods参考文献 13被引用 5
一句话总结

本文提出VTBR,一种基于语义的行人重识别(Re-ID)预训练方法,利用新构建的FineGPR-C数据集中密集的文本描述来从零开始训练CNN,其性能与ImageNet预训练相当,且所需图像数量最多减少1.4倍,证明了在Re-ID中使用语言监督预训练的可行性。

ABSTRACT

Pretraining is a dominant paradigm in computer vision. Generally, supervised ImageNet pretraining is commonly used to initialize the backbones of person re-identification (Re-ID) models. However, recent works show a surprising result that CNN-based pretraining on ImageNet has limited impacts on Re-ID system due to the large domain gap between ImageNet and person Re-ID data. To seek an alternative to traditional pretraining, here we investigate semantic-based pretraining as another method to utilize additional textual data against ImageNet pretraining. Specifically, we manually construct a diversified FineGPR-C caption dataset for the first time on person Re-ID events. Based on it, a pure semantic-based pretraining approach named VTBR is proposed to adopt dense captions to learn visual representations with fewer images. We train convolutional neural networks from scratch on the captions of FineGPR-C dataset, and then transfer them to downstream Re-ID tasks. Comprehensive experiments conducted on benchmark datasets show that our VTBR can achieve competitive performance compared with ImageNet pretraining - despite using up to 1.4x fewer images, revealing its potential in Re-ID pretraining.

研究动机与目标

  • 为解决ImageNet与行人Re-ID数据之间的域差距问题,该差距限制了传统ImageNet预训练的有效性。
  • 探索利用文本注释进行视觉表征学习的替代预训练范式,以促进Re-ID中的视觉表示学习。
  • 构建一个大规模、多样化、细粒度的字幕数据集(FineGPR-C),专门用于Re-ID事件,以支持基于语义的预训练。
  • 开发一种纯视觉-语义预训练框架(VTBR),通过图像-字幕对从零开始训练CNN。
  • 证明基于语义的预训练可实现与ImageNet预训练相当或更优的Re-ID性能,同时提升数据效率。

提出的方法

  • 通过人工标注行人图像,生成细粒度、多样化的文本描述,构建FineGPR-C字幕数据集。
  • 提出VTBR,一种视觉-语言预训练框架,联合训练ResNet和Transformer模型,以实现图像字幕生成。
  • 仅使用FineGPR-C数据集中的文本监督从零开始训练CNN主干网络,不依赖ImageNet。
  • 将预训练阶段学习到的视觉特征作为下游Re-ID任务的主干网络。
  • 在共享的视觉-语言嵌入空间中应用对比学习目标,以增强判别性特征学习。
  • 采用Grad-CAM可视化分析注意力图,验证模型能够聚焦于判别性身体部位和全局上下文。

实验结果

研究问题

  • RQ1使用密集文本字幕进行基于语义的预训练,是否能在行人重识别中实现优于或等同于ImageNet预训练的性能?
  • RQ2完全基于文本注释的预训练方法,能在多大程度上减少Re-ID中对大规模图像数据集的依赖?
  • RQ3从人工标注的细粒度字幕中学习视觉表征,是否能提升Re-ID任务中特征的判别性和鲁棒性?
  • RQ4预训练数据(FineGPR-C)与下游Re-ID数据集之间的域差距在多大程度上影响性能?该差距是否可被缓解?
  • RQ5从零开始在字幕上训练的视觉-语言预训练框架,是否能在极小数据量下且无需ImageNet预训练的情况下,实现具有竞争力的结果?

主要发现

  • 尽管使用图像数量最多减少1.4倍,VTBR在多个基准测试(如Market-1501、DukeMTMC-reID)上仍实现了具有竞争力的Re-ID性能。
  • 该方法在监督和无监督设置中均优于ImageNet预训练,证明了语义监督的有效性。
  • Grad-CAM可视化显示,VTBR模型更关注更具判别性的身体部位和全局上下文,表明其学习到了更优的特征表示。
  • FineGPR-C数据集支持高质量、细粒度的字幕生成,其监督密度高于传统预训练方法。
  • 所提方法降低了对ImageNet的依赖,为传统预训练提供了一种更隐私友好、数据高效的替代方案。
  • 结果表明,基于语义的预训练是ImageNet预训练在Re-ID中的可行且有前景的替代方案,尤其在存在域偏移问题时更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。