Skip to main content
QUICK REVIEW

[论文解读] Deep Template Matching for Pedestrian Attribute Recognition with the Auxiliary Supervision of Attribute-wise Keypoints

Jiajun Zhang, Pengyuan Ren|arXiv (Cornell University)|Nov 13, 2020
Video Surveillance and Tracking Methods参考文献 35被引用 10
一句话总结

本文提出深度模板匹配(DTM)方法,并引入基于属性的关键点(AWK)辅助监督,用于行人属性识别。该方法用轻量级、可微分的模板匹配机制替代传统分类器,以捕捉判别性局部特征。该方法在PETA、PA-100K、RAP和RAPv2 $zs$ 数据集上实现了最先进性能,计算成本更低,且推理复杂度未增加。

ABSTRACT

Pedestrian Attribute Recognition (PAR) has aroused extensive attention due to its important role in video surveillance scenarios. In most cases, the existence of a particular attribute is strongly related to a partial region. Recent works design complicated modules, e.g., attention mechanism and proposal of body parts to localize the attribute corresponding region. These works further prove that localization of attribute specific regions precisely will help in improving performance. However, these part-information-based methods are still not accurate as well as increasing model complexity which makes it hard to deploy on realistic applications. In this paper, we propose a Deep Template Matching based method to capture body parts features with less computation. Further, we also proposed an auxiliary supervision method that use human pose keypoints to guide the learning toward discriminative local cues. Extensive experiments show that the proposed method outperforms and has lower computational complexity, compared with the state-of-the-art approaches on large-scale pedestrian attribute datasets, including PETA, PA-100K, RAP, and RAPv2 zs.

研究动机与目标

  • 解决行人图像中属性特定区域定位的挑战,以提升识别准确率。
  • 相比依赖重型模块的注意力或提议方法,降低模型复杂度与推理成本。
  • 通过利用人体姿态关键点作为辅助监督,提升局部属性的特征学习能力。
  • 开发一种轻量级、可微分的模板匹配机制,替代分类任务中的全连接层。
  • 实现实时可部署的高性能行人属性识别,且不增加模型大小或推理成本。

提出的方法

  • 提出深度模板匹配(DTM),一种基于卷积层的可微分方法,通过全局平均池化(GAP)或全局最大池化(GMP)模拟经典模板匹配,以提取局部特征。
  • 采用可学习的模板初始化策略,避免因随机初始化导致的收敛困难与错误特征定位问题。
  • 通过属性特定关键点(AWK)施加辅助监督,利用人体姿态关键点位置引导DTM模块学习判别性局部特征。
  • 仅在训练阶段集成AWK监督模块,推理阶段不增加计算开销。
  • 在DTM中结合GAP与GMP池化,以平衡局部与全局属性的性能,提升整体鲁棒性。
  • 使用批量归一化进行训练,并通过消融实验分析小批量大小与池化策略对性能的影响。

实验结果

研究问题

  • RQ1轻量级、可微分的模板匹配机制是否能在行人属性识别中超越传统全连接分类器?
  • RQ2使用属性特定的人体姿态关键点作为辅助监督,是否能在不增加模型复杂度的前提下提升定位准确率与识别性能?
  • RQ3DTM与AWK的结合在PETA、PA-100K、RAP和RAPv2 $zs$ 等多样化基准上的性能表现如何?
  • RQ4池化方式选择(GAP与GMP)及小批量大小在多大程度上影响基于DTM模型的收敛性与性能?
  • RQ5与最先进注意力或提议模型相比,该方法是否能在显著降低计算成本的同时保持高准确率?

主要发现

  • 所提出的DTM+AWK方法在RAP数据集上达到82.04的平均准确率(mA),优于基线FC+BN方法(80.05 mA)。
  • AWK监督使大多数属性的mA提升4%至10%,尤其在局部属性如“背包”和“休闲鞋”上提升最为显著。
  • 采用GAP+GMP池化的DTM取得最佳整体性能(81.33 mA),优于仅使用GAP(81.25 mA)或GMP(77.72 mA)的DTM。
  • 消融实验证实,DTM本身即优于传统分类器,而加入AWK后进一步提升了基于标签的指标(mA)与F1分数。
  • 尽管增大小批量大小(通常可改善批量归一化统计量),基于DTM的模型在所有设置下仍保持更优性能,表明其具备强鲁棒性与泛化能力。
  • DTM热力图的可视化结果表明,在AWK监督下,注意力更准确、更聚焦于与属性相关的身体部位,优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。