Skip to main content
QUICK REVIEW

[论文解读] Learning Semantic-Aligned Feature Representation for Text-based Person Search

Shiping Li, Min Cao|arXiv (Cornell University)|Dec 13, 2021
Video Surveillance and Tracking Methods被引用 5
一句话总结

该论文提出了一种语义对齐特征聚合网络,利用视觉Transformer(ViT)和BERT主干网络,学习用于文本驱动行人检索的部件感知、跨模态对齐特征。通过使用多头注意力机制结合跨模态部件对齐损失和多样性损失,该方法在不依赖外部模型或复杂注意力机制的前提下,在CUHK-PEDES(64.13% Rank-1)和Flickr30K(50.74% Rank-1)上实现了最先进性能。

ABSTRACT

Text-based person search aims to retrieve images of a certain pedestrian by a textual description. The key challenge of this task is to eliminate the inter-modality gap and achieve the feature alignment across modalities. In this paper, we propose a semantic-aligned embedding method for text-based person search, in which the feature alignment across modalities is achieved by automatically learning the semantic-aligned visual features and textual features. First, we introduce two Transformer-based backbones to encode robust feature representations of the images and texts. Second, we design a semantic-aligned feature aggregation network to adaptively select and aggregate features with the same semantics into part-aware features, which is achieved by a multi-head attention module constrained by a cross-modality part alignment loss and a diversity loss. Experimental results on the CUHK-PEDES and Flickr30K datasets show that our method achieves state-of-the-art performances.

研究动机与目标

  • 通过在图像与文本之间实现细粒度、语义对齐的特征学习,解决文本驱动行人检索中的跨模态差异问题。
  • 克服现有全局匹配和局部匹配方法依赖预定义区域或复杂注意力机制的局限性。
  • 设计一种端到端可训练的架构,自动学习部件感知特征,无需额外模型或高昂推理开销。
  • 通过统一的轻量化框架整合全局与局部匹配信号,提升检索性能。

提出的方法

  • 利用视觉Transformer(ViT)和BERT作为模态特定的特征编码器,从图像和文本中提取鲁棒的高维表征。
  • 提出一种语义对齐特征聚合网络(SAFA),通过多头注意力机制自适应聚合跨模态共享语义的特征。
  • 施加跨模态部件对齐损失,确保关注的视觉块与文本中的词在语义上对应。
  • 应用多样性损失,促使注意力头聚焦于不同的语义部件,避免冗余并提升特征覆盖范围。
  • 结合[CLS]标记的全局特征与块/词特征,实现在统一框架下的联合全局与局部匹配。
  • 采用对比学习目标端到端训练整个模型,以优化最终的检索性能。

实验结果

研究问题

  • RQ1一个轻量级、端到端可训练的网络能否在不依赖外部模型的前提下,学习到图像与文本模态之间语义对齐的部件感知特征?
  • RQ2所提出的语义对齐特征聚合网络在性能与效率方面,相较于现有的基于注意力机制或基于规则的局部匹配方法有何差异?
  • RQ3跨模态部件对齐损失与多样性损失在多大程度上有助于提升检索准确率?
  • RQ4该方法能否在CUHK-PEDES与Flickr30K等不同基准上保持一致的最先进性能,展现出良好的泛化能力?
  • RQ5在超参数K(部件数量)与λ(多样性损失权重)方面,何种配置能实现最佳检索性能?

主要发现

  • 所提方法在CUHK-PEDES数据集上达到64.13%的Rank-1准确率,超越所有先前的最先进方法。
  • 在Flickr30K数据集上,该方法实现50.74%的Rank-1准确率,相比先前最先进方法显著提升超过8个百分点。
  • 消融实验表明,SAFA模块相比仅使用全局特征的基线模型,Rank-1准确率提升4.34%,证明了局部匹配的有效性。
  • 全局特征与部件感知特征的结合取得最佳性能,其中全局编码器提供了强有力的辅助信号。
  • 超参数分析确认,K=10与λ=0.2为最优配置,过高或过低的取值均会导致性能下降。
  • 注意力图可视化结果表明,每个注意力头在图像与文本中均聚焦于不同的语义部件,验证了跨模态对齐的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。