Skip to main content
QUICK REVIEW

[论文解读] DiP: Learning Discriminative Implicit Parts for Person Re-Identification

Dengjie Li, Siyu Chen|arXiv (Cornell University)|Dec 24, 2022
Video Surveillance and Tracking Methods被引用 10
一句话总结

本文提出判别性隐式部件(DiP)用于行人重识别,通过视觉Transformer中的可学习标记,学习灵活且与身体无关的特征,超越预定义部件。通过引入隐式位置进行几何对齐,以及通过DiP加权实现对遮挡的鲁棒性,DiP在MSMT17、Market-1501、Duke-ReID、CUHK03和Occluded-Duke上均达到最先进性能。

ABSTRACT

In person re-identification (ReID) tasks, many works explore the learning of part features to improve the performance over global image features. Existing methods explicitly extract part features by either using a hand-designed image division or keypoints obtained with external visual systems. In this work, we propose to learn Discriminative implicit Parts (DiPs) which are decoupled from explicit body parts. Therefore, DiPs can learn to extract any discriminative features that can benefit in distinguishing identities, which is beyond predefined body parts (such as accessories). Moreover, we propose a novel implicit position to give a geometric interpretation for each DiP. The implicit position can also serve as a learning signal to encourage DiPs to be more position-equivariant with the identity in the image. Lastly, an additional DiP weighting is introduced to handle the invisible or occluded situation and further improve the feature representation of DiPs. Extensive experiments show that the proposed method achieves state-of-the-art performance on multiple person ReID benchmarks.

研究动机与目标

  • 解决行人重识别中显式部件方法的局限性,这些方法依赖于刚性划分或外部关键点先验。
  • 学习不受限于显式身体部位(如配饰或衣物细节)的判别性特征。
  • 通过隐式位置引入几何归纳偏置,提升特征对齐性与遮挡及姿态变化下的鲁棒性。
  • 通过DiP加权机制建模各部件的可见性与贡献度,提升细粒度身份对比能力。
  • 在无需外部监督或固定划分的情况下,在多个标准行人重识别基准上实现最先进性能。

提出的方法

  • 在视觉Transformer的输入序列末尾添加可学习的、随机初始化的标记,端到端提取判别性隐式部件(DiPs)。
  • 通过DiP与图像块特征之间的相关性注意力,为每个DiP定义隐式位置,提供几何可解释性。
  • 通过可学习头部训练DiP预测其自身的隐式位置,以鼓励其在图像中对身份保持位置等变性。
  • 引入DiP加权机制,通过多层感知机学习各部件的可见性权重,以调制特征贡献度。
  • 设计基于部件的距离计算方法,使用加权DiP特征而非全局特征进行身份比较,实现细粒度匹配。
  • 通过联合优化身份损失、欧氏三元组损失、基于部件的三元组损失和位置预测损失来训练模型。

实验结果

研究问题

  • RQ1端到端学习的隐式部件是否能超越显式定义或基于关键点的部件特征在行人重识别中的表现?
  • RQ2隐式位置能否提供几何监督,从而在无显式监督下改善特征定位与位置等变性?
  • RQ3通过DiP加权建模部件可见性是否能提升对遮挡和部分可见性的鲁棒性?
  • RQ4DiP的数量如何影响性能?容量与泛化能力之间存在怎样的最优权衡?
  • RQ5基于DiP的部件距离度量是否能实现优于全局特征匹配的判别能力?

主要发现

  • DiP在MSMT17上达到最先进性能,R1为83.6%,mAP为65.7%,超越先前方法。
  • 在Market-1501上,DiP实现94.5% R1和87.0% mAP,相较于基线和先前SOTA方法均有稳定提升。
  • 消融实验表明,当DiP数量为12时,DiP加权机制可使MSMT17的性能提升最高达0.7% R1和1.8% mAP。
  • 最优DiP数量为12,当增至16时性能下降,表明存在明确的容量权衡。
  • 可视化结果表明,DiP关注判别性强的非显式区域,如围巾、背包和书包带,不限于身体部位。
  • DiP权重与可见性相关:被遮挡区域权重较低(如0.847),完全可见部分权重为1.0,验证了加权机制的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。