[论文解读] Rethinking Person Re-Identification via Semantic-Based Pretraining
本文提出VTBR,一种基于语义的行人重识别(Re-ID)预训练方法,利用新构建的FineGPR-C数据集中密集的文本描述来从零开始训练CNN,其性能与ImageNet预训练相当,且所需图像数量最多减少1.4倍,证明了在Re-ID中使用语言监督预训练的可行性。
Pretraining is a dominant paradigm in computer vision. Generally, supervised ImageNet pretraining is commonly used to initialize the backbones of person re-identification (Re-ID) models. However, recent works show a surprising result that CNN-based pretraining on ImageNet has limited impacts on Re-ID system due to the large domain gap between ImageNet and person Re-ID data. To seek an alternative to traditional pretraining, here we investigate semantic-based pretraining as another method to utilize additional textual data against ImageNet pretraining. Specifically, we manually construct a diversified FineGPR-C caption dataset for the first time on person Re-ID events. Based on it, a pure semantic-based pretraining approach named VTBR is proposed to adopt dense captions to learn visual representations with fewer images. We train convolutional neural networks from scratch on the captions of FineGPR-C dataset, and then transfer them to downstream Re-ID tasks. Comprehensive experiments conducted on benchmark datasets show that our VTBR can achieve competitive performance compared with ImageNet pretraining - despite using up to 1.4x fewer images, revealing its potential in Re-ID pretraining.
研究动机与目标
- 为解决ImageNet与行人Re-ID数据之间的域差距问题,该差距限制了传统ImageNet预训练的有效性。
- 探索利用文本注释进行视觉表征学习的替代预训练范式,以促进Re-ID中的视觉表示学习。
- 构建一个大规模、多样化、细粒度的字幕数据集(FineGPR-C),专门用于Re-ID事件,以支持基于语义的预训练。
- 开发一种纯视觉-语义预训练框架(VTBR),通过图像-字幕对从零开始训练CNN。
- 证明基于语义的预训练可实现与ImageNet预训练相当或更优的Re-ID性能,同时提升数据效率。
提出的方法
- 通过人工标注行人图像,生成细粒度、多样化的文本描述,构建FineGPR-C字幕数据集。
- 提出VTBR,一种视觉-语言预训练框架,联合训练ResNet和Transformer模型,以实现图像字幕生成。
- 仅使用FineGPR-C数据集中的文本监督从零开始训练CNN主干网络,不依赖ImageNet。
- 将预训练阶段学习到的视觉特征作为下游Re-ID任务的主干网络。
- 在共享的视觉-语言嵌入空间中应用对比学习目标,以增强判别性特征学习。
- 采用Grad-CAM可视化分析注意力图,验证模型能够聚焦于判别性身体部位和全局上下文。
实验结果
研究问题
- RQ1使用密集文本字幕进行基于语义的预训练,是否能在行人重识别中实现优于或等同于ImageNet预训练的性能?
- RQ2完全基于文本注释的预训练方法,能在多大程度上减少Re-ID中对大规模图像数据集的依赖?
- RQ3从人工标注的细粒度字幕中学习视觉表征,是否能提升Re-ID任务中特征的判别性和鲁棒性?
- RQ4预训练数据(FineGPR-C)与下游Re-ID数据集之间的域差距在多大程度上影响性能?该差距是否可被缓解?
- RQ5从零开始在字幕上训练的视觉-语言预训练框架,是否能在极小数据量下且无需ImageNet预训练的情况下,实现具有竞争力的结果?
主要发现
- 尽管使用图像数量最多减少1.4倍,VTBR在多个基准测试(如Market-1501、DukeMTMC-reID)上仍实现了具有竞争力的Re-ID性能。
- 该方法在监督和无监督设置中均优于ImageNet预训练,证明了语义监督的有效性。
- Grad-CAM可视化显示,VTBR模型更关注更具判别性的身体部位和全局上下文,表明其学习到了更优的特征表示。
- FineGPR-C数据集支持高质量、细粒度的字幕生成,其监督密度高于传统预训练方法。
- 所提方法降低了对ImageNet的依赖,为传统预训练提供了一种更隐私友好、数据高效的替代方案。
- 结果表明,基于语义的预训练是ImageNet预训练在Re-ID中的可行且有前景的替代方案,尤其在存在域偏移问题时更具优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。