Skip to main content
QUICK REVIEW

[论文解读] Augmented Parallel-Pyramid Net for Attention Guided Pose-Estimation

Luanxuan Hou, Jie Cao|arXiv (Cornell University)|Mar 17, 2020
Human Pose and Action Recognition参考文献 40被引用 4
一句话总结

本文提出了一种增强的并行金字塔网络(P² Net),包含注意力部分模块(APM)和可微分自动数据增强,用于自顶向下的人体姿态估计。通过使用并行特征金字塔来保留空间和语义信息,并利用APM动态融合多尺度特征,该方法在COCO和MPII基准上实现了最先进性能,COCO上达到82.5 AP,MPII上达到92.4 PCKh@0.5。

ABSTRACT

The target of human pose estimation is to determine body part or joint locations of each person from an image. This is a challenging problems with wide applications. To address this issue, this paper proposes an augmented parallel-pyramid net with attention partial module and differentiable auto-data augmentation. Technically, a parallel pyramid structure is proposed to compensate the loss of information. We take the design of parallel structure for reverse compensation. Meanwhile, the overall computational complexity does not increase. We further define an Attention Partial Module (APM) operator to extract weighted features from different scale feature maps generated by the parallel pyramid structure. Compared with refining through upsampling operator, APM can better capture the relationship between channels. At last, we proposed a differentiable auto data augmentation method to further improve estimation accuracy. We define a new pose search space where the sequences of data augmentations are formulated as a trainable and operational CNN component. Experiments corroborate the effectiveness of our proposed method. Notably, our method achieves the top-1 accuracy on the challenging COCO keypoint benchmark and the state-of-the-art results on the MPII datasets.

研究动机与目标

  • 解决在复杂姿态和背景的非约束环境下遮挡与不可见关键点检测的挑战。
  • 在保持计算效率的同时,克服传统金字塔网络因下采样导致的深层特征图信息丢失问题。
  • 通过用可学习的注意力机制替代上采样方式的特征细化,改进多尺度表征之间的特征融合。
  • 采用可微分、端到端可训练的方法,自动搜索姿态估计的数据增强策略,替代手工设计或强化学习方法。
  • 在不依赖重型模型架构的前提下,实现在标准基准上的最先进性能。

提出的方法

  • 引入一种并行金字塔结构(ParallelNet),在主干网络并行学习高分辨率特征,保留标准自顶向下网络中丢失的空间细节。
  • 设计一种注意力部分模块(APM),通过学习通道级注意力权重,自适应地融合不同尺度的特征,提升特征表示能力,优于简单的拼接或上采样操作。
  • 用空洞瓶颈结构替代标准的上采样特征细化方式,以保持大感受野和高分辨率特征。
  • 提出一种可微分自动数据增强方法(Auto-Pose),将增强序列建模为网络中的可训练、可微分组件,支持基于梯度的增强策略搜索。
  • 定义了一种新的姿态特定增强策略搜索空间,其中颜色抖动、Mixup和Cutout等超参数为可微分,并在训练过程中联合优化。
  • 采用自顶向下流程:首先使用DetNet检测人体,然后在每个检测到的边界框内应用P² Net结合APM与自动增强,以预测关键点热力图。

实验结果

研究问题

  • RQ1并行金字塔架构是否能在不增加计算成本的前提下,有效保留深层姿态估计网络中的空间与语义信息?
  • RQ2基于注意力的特征融合机制(APM)是否在多尺度特征融合中优于标准的上采样与拼接操作,从而提升关键点定位性能?
  • RQ3可微分自动增强是否能显著提升人体姿态估计中的泛化能力与准确性,相比手工设计或强化学习方法?
  • RQ4在存在遮挡与大姿态变化的真实世界条件下,该方法在MS COCO与MPII等挑战性基准上的表现如何?
  • RQ5人体检测器的选择在多大程度上影响最终关键点估计的准确性?更好的检测器是否能独立于姿态头提升性能?

主要发现

  • 所提出的P² Net在MS COCO测试开发集上达到82.5 AP,创下新的最先进结果。
  • 在MPII基准上,该方法达到92.4 PCKh@0.5,超越了包括HRNet-W32在内的先前最先进方法。
  • 消融实验表明,与无注意力的基线相比,注意力部分模块(APM)使AP提升0.3个百分点,证明其在特征融合中的有效性。
  • 可微分自动增强组件对性能提升贡献显著,消融实验显示其在多样化测试条件下增强了模型的鲁棒性与泛化能力。
  • 该方法在模型参数更少的情况下实现更高精度(47.5M vs. 68.6M),表明其具有更好的参数效率。
  • 检测器消融实验表明,更高的行人检测mAP并不一定带来更好的关键点AP,说明关键点头的性能比检测质量本身更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。