Skip to main content
QUICK REVIEW

[论文解读] Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search

Ya Jing, Chenyang Si|arXiv (Cornell University)|Sep 22, 2018
Video Surveillance and Tracking Methods参考文献 32被引用 15
一句话总结

本文提出了一种姿态引导的多粒度注意力网络(PMA),用于文本驱动行人检索,通过全局图文相似性实现粗粒度对齐,并利用人体姿态实现细粒度对齐,将名词短语与特定身体部位关联。该方法通过姿态感知注意力机制有效建模多粒度视觉-文本对齐,在CUHK-PEDES数据集上相较最先进方法实现了15%的top-1准确率提升。

ABSTRACT

Text-based person search aims to retrieve the corresponding person images in an image database by virtue of a describing sentence about the person, which poses great potential for various applications such as video surveillance. Extracting visual contents corresponding to the human description is the key to this cross-modal matching problem. Moreover, correlated images and descriptions involve different granularities of semantic relevance, which is usually ignored in previous methods. To exploit the multilevel corresponding visual contents, we propose a pose-guided multi-granularity attention network (PMA). Firstly, we propose a coarse alignment network (CA) to select the related image regions to the global description by a similarity-based attention. To further capture the phrase-related visual body part, a fine-grained alignment network (FA) is proposed, which employs pose information to learn latent semantic alignment between visual body part and textual noun phrase. To verify the effectiveness of our model, we perform extensive experiments on the CUHK Person Description Dataset (CUHK-PEDES) which is currently the only available dataset for text-based person search. Experimental results show that our approach outperforms the state-of-the-art methods by 15 \% in terms of the top-1 metric.

研究动机与目标

  • 通过建模文本描述与视觉特征之间的多粒度语义相关性,解决文本驱动行人检索中的跨模态匹配问题。
  • 通过聚焦于描述相关图像区域,改善视觉特征选择,减少背景和无关内容的干扰。
  • 利用人体姿态作为监督信号,增强文本名词短语与特定人体部位之间的细粒度对齐。
  • 开发一个统一框架,整合粗粒度与细粒度注意力机制,以提升检索性能。

提出的方法

  • 粗粒度对齐网络(CA)使用基于相似性的硬注意力机制,选择与完整文本描述最相关的图像区域。
  • 将姿态置信度图与输入图像拼接,以增强全局表征并指导区域选择。
  • 细粒度对齐网络(FA)利用姿态信息,引导单个名词短语与对应视觉身体部位之间的注意力。
  • FA使用软注意力机制结合姿态引导的特征对齐,以建模短语级别的潜在语义对应关系。
  • 通过排名损失和识别损失联合训练模型,以提升泛化能力和匹配准确率。
  • 在CA中应用硬注意力以过滤低相似度区域,而在FA中使用软注意力以实现更平滑的特征加权。

实验结果

研究问题

  • RQ1文本与图像之间的多粒度对齐是否能提升文本驱动行人检索的性能?
  • RQ2引入人体姿态信息在多大程度上提升了细粒度视觉-文本匹配的准确性?
  • RQ3与单个词语相比,使用名词短语是否能实现与特定身体部位更好的对齐?
  • RQ4在选择与描述相关的图像区域时,硬注意力在多大程度上优于软注意力?
  • RQ5姿态引导的注意力机制在多大程度上提升了相关视觉特征的可解释性与定位能力?

主要发现

  • 所提出的PMA模型在CUHK-PEDES数据集上实现了53.81%的top-1准确率,相较最先进方法有15%的相对提升。
  • 粗粒度对齐网络(CA)为正样本图像-文本对选择约6个相关图像区域,为负样本对最多选择20个区域,表明其能有效过滤无关内容。
  • 消融实验表明,若移除姿态信息,top-1准确率降至52.54%,证实姿态信息在细粒度对齐中的关键作用。
  • 若移除名词短语引导,性能降至52.71%的top-1准确率,表明短语级别的语义比词级别的特征更具信息量。
  • 采用CA中硬注意力的模型优于软注意力,证明过滤低相似度区域可提升匹配的鲁棒性。
  • 定性可视化结果表明,模型能关注到相关身体部位(如‘tennis shoes’对应脚部)及对应文本短语,增强了可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。