Skip to main content
QUICK REVIEW

[论文解读] Pose-Aware Person Recognition

Vijay Kumar, Anoop Namboodiri|arXiv (Cornell University)|May 29, 2017
Face recognition and analysis参考文献 40被引用 8
一句话总结

本论文提出了一种姿态感知的人体识别框架,通过使用针对特定姿态的深度模型,并在多个身体区域上进行联合优化,结合姿态感知的融合策略,以提升在极端姿态变化下的识别性能。该方法在包括照片相册、电影和体育视频在内的多样化基准数据集上实现了最先进(SOTA)的性能,其在PIPA数据集上的rank-1准确率为96.56%,在Hannah数据集上为84.83%,在Soccer数据集上为63.2%。

ABSTRACT

Person recognition methods that use multiple body regions have shown significant improvements over traditional face-based recognition. One of the primary challenges in full-body person recognition is the extreme variation in pose and view point. In this work, (i) we present an approach that tackles pose variations utilizing multiple models that are trained on specific poses, and combined using pose-aware weights during testing. (ii) For learning a person representation, we propose a network that jointly optimizes a single loss over multiple body regions. (iii) Finally, we introduce new benchmarks to evaluate person recognition in diverse scenarios and show significant improvements over previously proposed approaches on all the benchmarks including the photo album setting of PIPA.

研究动机与目标

  • 解决在全身人体识别中因极端姿态和视角变化带来的挑战,特别是在面部被遮挡或不可用的情况下。
  • 通过学习视角特定的判别性身体部位特征,克服姿态无关表征和姿态归一化方法的局限性。
  • 提升在现实场景(如电影和体育视频)中的识别鲁棒性,这些场景中姿态多样性高且正面视角稀少。
  • 构建一个统一的跨领域评估框架,涵盖照片相册、电影和体育视频等多个领域,超越以往研究局限于照片相册设置的局限。
  • 提出一种姿态感知的融合策略,根据估计的姿态可能性动态加权分类器输出,从而在多样化姿态下提升识别性能。

提出的方法

  • 将姿态空间划分为离散的簇(例如:正面、半侧身、侧身、背面),以训练针对不同视角的多部位卷积神经网络(PSMs)。
  • 通过共享的网络架构,在多个身体部位(头部和上半身)上联合优化单一识别损失,实现灵活的特征利用。
  • 在推理阶段使用姿态估计器预测每种子类姿态的可能性,从而生成用于组合分类器得分的姿态感知权重。
  • 通过加权平均法结合多个姿态特定模型和基础模型的预测结果,其中权重来源于姿态估计器的输出。
  • 从网络最后一层提取深度特征(例如,fc7特征),并通过拼接和池化策略降低特征维度。
  • 对预测得分应用l2归一化,以支持在开放集识别场景中基于置信度拒绝未知身份。

实验结果

研究问题

  • RQ1与姿态无关的模型相比,针对不同身体部位训练的姿态特定深度模型是否能在极端姿态变化下提升人体识别性能?
  • RQ2通过单个损失函数在多个身体部位上进行联合优化,是否能比为每个部位单独训练获得更优的表征?
  • RQ3一种基于姿态可能性动态加权分类器输出的姿态感知融合策略,是否能提升在多样化姿态下的识别性能?
  • RQ4在现实世界、开放集场景(如电影和体育视频)中,该方法表现如何,这些场景中姿态多样性高且存在大量未知身份?
  • RQ5该框架是否能有效泛化到姿态分布不平衡的数据集(如以背面或侧身视角为主的数据集)?

主要发现

  • 所提出的姿态感知框架在PIPA数据集上实现了96.56%的rank-1准确率,显著优于先前方法在照片相册设置下的表现。
  • 在更具挑战性的Hannah数据集(电影领域)上,该方法实现了84.83%的rank-1准确率,表明其对多样化且非正面姿态具有强鲁棒性。
  • 在包含大量背面视角图像的足球数据集上,该方法实现了63.2%的rank-1准确率,尽管存在姿态分布不平衡问题,仍优于基线方法。
  • 采用学习权重的姿态感知融合策略优于平均池化和其他集成策略,在Hannah数据集上rank-1与rank-2性能差距达12%,表明对最高预测结果具有高度置信。
  • 该方法展现出优越的未知样本拒绝能力,ROC AUC得分表明,姿态感知表征的归一化预测得分在检测分布外样本方面更具可靠性。
  • 最终特征维度约为18,384 × 8 = 147,072,比PIPER小约3倍,比naeil大约2倍,且在使用16,000维特征向量时仍实现了高于naeil的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。