Skip to main content
QUICK REVIEW

[论文解读] Exploring Part-Informed Visual-Language Learning for Person Re-Identification

Lin Yin, Yehansen Chen|arXiv (Cornell University)|Aug 4, 2023
Video Surveillance and Tracking Methods被引用 7
一句话总结

本文提出 $π$-VL,一种用于行人重识别的部件感知视觉-语言学习框架,通过基于解析引导的、身份感知的文本提示以及分层视觉特征融合,增强细粒度特征学习。通过利用人体解析图和身份标签实现像素级图像-文本对齐,$π$-VL 在无需额外组件的情况下实现了最先进性能,包括在 MSMT17 上达到 90.3% 的 Rank-1 和 76.5% 的 mAP。

ABSTRACT

Recently, visual-language learning (VLL) has shown great potential in enhancing visual-based person re-identification (ReID). Existing VLL-based ReID methods typically focus on image-text feature alignment at the whole-body level, while neglecting supervision on fine-grained part features, thus lacking constraints for local feature semantic consistency. To this end, we propose Part-Informed Visual-language Learning ($π$-VL) to enhance fine-grained visual features with part-informed language supervisions for ReID tasks. Specifically, $π$-VL introduces a human parsing-guided prompt tuning strategy and a hierarchical visual-language alignment paradigm to ensure within-part feature semantic consistency. The former combines both identity labels and human parsing maps to constitute pixel-level text prompts, and the latter fuses multi-scale visual features with a light-weight auxiliary head to perform fine-grained image-text alignment. As a plug-and-play and inference-free solution, our $π$-VL achieves performance comparable to or better than state-of-the-art methods on four commonly used ReID benchmarks. Notably, it reports 91.0% Rank-1 and 76.9% mAP on the challenging MSMT17 database, without bells and whistles.

研究动机与目标

  • 解决现有基于视觉-语言学习的行人重识别方法中依赖全局图像-文本对齐所导致的部件内语义不一致问题。
  • 通过在文本提示生成中引入人体解析图和身份标签,提升细粒度视觉特征学习能力。
  • 设计一种分层融合机制,增强多阶段视觉特征,以提升语义一致性和判别性。
  • 开发一种即插即用、基于损失的解决方案,兼容多种 CNN 和 ViT 主干网络,适用于通用行人重识别应用。

提出的方法

  • 提出一种基于人体解析图的提示微调策略,结合身份标签与解析图,生成像素级文本提示,实现细粒度监督。
  • 设计一个轻量级辅助头,融合主干网络输出的多阶段视觉特征,实现分层视觉-语言对齐。
  • 利用生成的部件感知提示执行像素级图像-文本对齐,以增强局部特征的语义与一致性。
  • 将该方法作为即插即用的前端模块集成,无需修改主干网络或推理流程。
  • 使用离线获取的高质量解析图,以减少标签噪声,稳定视觉-语言学习训练过程。
  • 采用两阶段训练策略:首先使用 CLIP 的文本编码器进行提示微调;其次通过知识蒸馏,将部件感知语义迁移至轻量级视觉模型。

实验结果

研究问题

  • RQ1与全局图像-文本对齐相比,部件感知视觉-语言学习是否能提升行人重识别中部件内的特征语义一致性?
  • RQ2在提示微调中结合身份标签与解析图,对细粒度特征的判别能力有何影响?
  • RQ3分层视觉特征融合在多大程度上提升了视觉-语言学习在行人重识别中的性能?
  • RQ4所提方法是否能在不同主干网络架构(包括 ViT 和基于 CNN 的模型)上实现良好泛化?
  • RQ5在低资源环境下,使用解析图增强的提示是否能提升向轻量级模型迁移的能力?

主要发现

  • $π$-VL 在 MSMT17 上实现了新的最先进性能,达到 90.3% 的 Rank-1 和 76.5% 的 mAP,且未引入额外组件。
  • 在 Market-1501 上,$π$-VL 达到 96.1% 的 Rank-1 和 90.2% 的 mAP,即使使用标准 CLIP 主干网络也表现出强大性能。
  • 该方法在四个主要行人重识别基准(包括 Market-1501、DukeMTMC、CUHK03 和 MSMT17)上均表现出一致的性能提升。
  • 迁移实验表明,与全局提示相比,$π$-VL 的部件感知提示使基于 MobileNetV2 的学生模型在 Rank-1 上提升 +2.1%,mAP 上提升 +1.6%。
  • 可视化结果表明,$π$-VL 能有效突出面部、鞋子和衣物等与身份相关的关键身体部位,即使在背景复杂的情况下也表现良好。
  • 该方法对解析图质量变化具有鲁棒性,由于特征图级对齐与下采样机制,性能在不同解析模型之间保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。