Skip to main content
QUICK REVIEW

[论文解读] Sequence-based Person Attribute Recognition with Joint CTC-Attention Model

Hao Liu, Jingjing Wu|arXiv (Cornell University)|Nov 20, 2018
Video Surveillance and Tracking Methods参考文献 27被引用 11
一句话总结

本文提出一种用于基于序列的行人属性识别的联合 CTC-Attention 模型(JCM),将图像和属性标签均编码为序列,利用连接时序分类(CTC)损失提升特征编码能力,并通过注意力机制解码语义关系。该方法在 Market-1501、DukeMTMC 和 PETA 数据集上达到最先进性能,其中在 Market-1501 上实现 91.3% 的 Rank-1 准确率和 89.7% 的 mAP,证明其对属性顺序具有鲁棒性,并通过联合学习显著提升了重识别性能。

ABSTRACT

Attribute recognition has become crucial because of its wide applications in many computer vision tasks, such as person re-identification. Like many object recognition problems, variations in viewpoints, illumination, and recognition at far distance, all make this task challenging. In this work, we propose a joint CTC-Attention model (JCM), which maps attribute labels into sequences to learn the semantic relationship among attributes. Besides, this network uses neural network to encode images into sequences, and employs connectionist temporal classification (CTC) loss to train the network with the aim of improving the encoding performance of the network. At the same time, it adopts the attention model to decode the sequences, which can realize aligning the sequences and better learning the semantic information from attributes. Extensive experiments on three public datasets, i.e., Market-1501 attribute dataset, Duke attribute dataset and PETA dataset, demonstrate the effectiveness of the proposed method.

研究动机与目标

  • 解决行人重识别与属性识别中行人属性之间的语义相关性挑战。
  • 克服现有方法对属性顺序敏感且序列对齐能力弱的局限性。
  • 通过序列学习建模属性关系,提升对视角、光照和远距离检测变化的鲁棒性。
  • 联合学习重识别与属性识别,实现性能相互增强。
  • 引入 CTC 损失与基于注意力的解码机制,实现无需人工指定属性顺序的端到端序列建模。

提出的方法

  • 使用预定义映射表将所有行人属性映射为固定长度的数字序列,以表征语义关系。
  • 利用卷积神经网络(CNN)将输入图像编码为序列化特征表示。
  • 应用连接时序分类(CTC)损失训练网络,无需输入与输出序列间的精确对齐,从而实现鲁棒的序列编码。
  • 采用基于 Transformer 的注意力机制并行解码属性序列,实现一次完整的序列预测,提升语义特征学习能力。
  • 通过带超参数 λ 的加权损失函数,联合训练属性识别与行人重识别任务,以平衡两者。
  • 利用多个数据集(如 PETA 中的 TownCenter 等)进行混合训练,以增强泛化能力与模型鲁棒性。

实验结果

研究问题

  • RQ1将行人属性建模为序列是否能通过捕捉属性间的语义相关性来提升识别性能?
  • RQ2使用 CTC 损失是否能增强网络在无需精确真实标签对齐情况下的图像到属性序列对齐学习能力?
  • RQ3基于注意力的序列解码在多大程度上提升了属性预测的准确率与对属性顺序的鲁棒性?
  • RQ4联合学习属性识别与行人重识别对两项任务性能的影响如何?
  • RQ5由于混合训练,所提方法是否对属性顺序与数据集分布变化具有鲁棒性?

主要发现

  • 联合 CTC-Attention 模型(JCM)在 Market-1501 数据集上实现 91.3% 的 Rank-1 准确率与 89.7% 的 mAP,优于最先进方法。
  • 即使移除如 'age' 和 'hat' 等单个属性,模型仍保持高性能,Rank-1 准确率分别仅下降 2.5% 和 2.7%,表明这些属性贡献显著。
  • 方法对属性顺序具有鲁棒性,不同映射表配置下性能保持一致,证实 CTC 损失实现了顺序无关的学习。
  • 联合训练属性识别与行人重识别可获得更优结果:91.3% Rank-1 与 89.7% mAP,而单独训练时仅为 89.0% 与 88.8%。
  • 在多个 PETA 数据集上进行混合训练显著提升泛化能力,在 TownCenter 上实现 87.7% Rank-1 与 91.8% mAP,优于独立训练(83.9% 与 90.1%)。
  • 从基础 CNN 层(28×2048)提取的特征在 Market-1501 与 PETA 上均优于从密集模型(1024 维)提取的特征,表明深层特征更具判别性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。