Skip to main content
QUICK REVIEW

[论文解读] Unified Pre-training with Pseudo Texts for Text-To-Image Person Re-identification

Zhiyin Shao, Xinyu Zhang|arXiv (Cornell University)|Sep 4, 2023
Video Surveillance and Tracking MethodsComputer Science被引用 3
一句话总结

该论文提出UniPT,一种用于文本到图像行人重识别(T2I-ReID)的统一预训练框架,通过采用基于CLIP的分治合并策略构建大规模伪标注行人数据集LUPerson-T,解决了数据与训练过程中的不一致性问题。该方法通过对比学习与掩码语言建模联合预训练视觉与语言编码器,在CUHK-PEDES数据集上实现了SOTA性能,Rank-1准确率达到68.50%。

ABSTRACT

The pre-training task is indispensable for the text-to-image person re-identification (T2I-ReID) task. However, there are two underlying inconsistencies between these two tasks that may impact the performance; i) Data inconsistency. A large domain gap exists between the generic images/texts used in public pre-trained models and the specific person data in the T2I-ReID task. This gap is especially severe for texts, as general textual data are usually unable to describe specific people in fine-grained detail. ii) Training inconsistency. The processes of pre-training of images and texts are independent, despite cross-modality learning being critical to T2I-ReID. To address the above issues, we present a new unified pre-training pipeline (UniPT) designed specifically for the T2I-ReID task. We first build a large-scale text-labeled person dataset "LUPerson-T", in which pseudo-textual descriptions of images are automatically generated by the CLIP paradigm using a divide-conquer-combine strategy. Benefiting from this dataset, we then utilize a simple vision-and-language pre-training framework to explicitly align the feature space of the image and text modalities during pre-training. In this way, the pre-training task and the T2I-ReID task are made consistent with each other on both data and training levels. Without the need for any bells and whistles, our UniPT achieves competitive Rank-1 accuracy of, ie, 68.50%, 60.09%, and 51.85% on CUHK-PEDES, ICFG-PEDES and RSTPReid, respectively. Both the LUPerson-T dataset and code are available at https;//github.com/ZhiyinShao-H/UniPT.

研究动机与目标

  • 解决通用预训练数据与行人特定T2I-ReID数据之间的数据域差距问题。
  • 解决图像与文本编码器独立预训练但需跨模态对齐所导致的训练不一致问题。
  • 通过在数据与训练层面统一预训练与下游任务的分布,提升T2I-ReID性能。
  • 开发一种可扩展、自动化的细粒度行人特定文本描述生成方法,无需人工标注。

提出的方法

  • 构建LUPerson-T,一个大规模图文数据集,其伪描述通过基于CLIP的分治合并策略生成。
  • 将行人属性划分为短语(如“蓝色条纹衬衫”),利用冻结的CLIP模型将这些短语匹配至图像,并通过模板组合成完整描述。
  • 采用同义词替换以提升描述多样性并减少冗余。
  • 采用视觉与语言预训练框架,通过图文对之间的对比损失以及掩码语言建模,防止过拟合。
  • 通过对比学习与掩码语言建模双重目标,联合预训练视觉与文本编码器,以对齐特征空间。
  • 将统一预训练的输出作为下游T2I-ReID任务的强初始化。

实验结果

研究问题

  • RQ1自动化生成的伪标注行人特定文本描述是否能有效缓解T2I-ReID预训练中的数据域差距?
  • RQ2与独立预训练相比,视觉与语言编码器的联合预训练是否能提升下游T2I-ReID性能?
  • RQ3一种镜像下游任务数据与训练格式的统一预训练流程,是否能带来更好的泛化性与性能?
  • RQ4伪文本的质量与多样性在零样本与跨域设置下对模型性能有何影响?

主要发现

  • UniPT在CUHK-PEDES上使用DeiT-small模型达到68.50%的Rank-1准确率,优于先前SOTA方法LGUR(+1.58%)与IVT(+2.91%)。
  • 在ICFG-PEDES上,UniPT使用DeiT-small达到60.09%的Rank-1准确率,使用ViT-B/16达到61.42%,超过LGUR与IVT。
  • 在跨域泛化设置中,UniPT在C→I与I→C设置下分别较SSAN(w/ BERT)提升+6.27%与+7.41%。
  • 模型展现出强大的域泛化能力,在C→I与I→C设置下分别较LGUR提升+1.26%与+3.04%。
  • 消融实验表明,多样化模板与受控数据规模(130万对)的结合可最大化性能,而过多数据会引入噪声。
  • 引入Lpgu(基于原型的粒度统一)进一步提升了特征表示能力,验证了其在统一预训练设置下的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。