Skip to main content
QUICK REVIEW

[论文解读] Pose Recognition with Cascade Transformers

Ke Li, Shijie Wang|arXiv (Cornell University)|Apr 14, 2021
Human Pose and Action Recognition参考文献 39被引用 7
一句话总结

本文提出了一种新型端到端回归方法——姿态回归Transformer(PRTR),采用级联Transformer架构,利用多尺度特征与基于查询的优化机制,在COCO数据集上实现了回归方法中的最先进性能,同时减少了启发式设计,并通过查询可视化提升了可解释性。

ABSTRACT

In this paper, we present a regression-based pose recognition method using cascade Transformers. One way to categorize the existing approaches in this domain is to separate them into 1). heatmap-based and 2). regression-based. In general, heatmap-based methods achieve higher accuracy but are subject to various heuristic designs (not end-to-end mostly), whereas regression-based approaches attain relatively lower accuracy but they have less intermediate non-differentiable steps. Here we utilize the encoder-decoder structure in Transformers to perform regression-based person and keypoint detection that is general-purpose and requires less heuristic design compared with the existing approaches. We demonstrate the keypoint hypothesis (query) refinement process across different self-attention layers to reveal the recursive self-attention mechanism in Transformers. In the experiments, we report competitive results for pose recognition when compared with the competing regression-based methods.

研究动机与目标

  • 为解决基于热力图的姿态估计方法依赖不可微、启发式预/后处理步骤的局限性。
  • 开发一种通用的、端到端的回归方法,用于多人2D人体姿态估计,同时降低网络架构复杂度。
  • 通过可视化解码器各层中查询的优化过程,探究Transformer在关键点检测中的内部工作机制。
  • 在保持训练目标与损失计算透明性的同时,实现与现有回归方法相当的性能表现。

提出的方法

  • 提出一种两阶段级联Transformer架构:基于DETR框架的人员检测Transformer与关键点检测Transformer。
  • 引入一种端到端的序列变体,利用空间变换网络(STN)联合预测边界框并优化关键点查询。
  • 在关键点检测Transformer中使用可学习的对象查询,直接预测17个关键点坐标,并在注意力层中观察到类别特异性查询专一化现象。
  • 在关键点检测头中引入多尺度特征融合,以提升不同尺寸目标下的定位精度。
  • 采用匈牙利匹配器并结合置信度匹配策略,在推理阶段排除背景类别的logits,以提升候选多样性。
  • 通过可视化解码器各层中查询的分布与优化轨迹,揭示递归自注意力机制与逐步的空间精炼过程。

实验结果

研究问题

  • RQ1级联Transformer架构是否能在消除复杂基于热力图的后处理启发式步骤的同时,实现具有竞争力的姿态估计精度?
  • RQ2Transformer解码器中的对象查询如何在各层中演化,从而将随机初始化的预测逐步优化为准确的关键点定位?
  • RQ3在精度与泛化能力方面,端到端训练下直接坐标回归方法相较于现有回归方法是否表现更优或相当?
  • RQ4在回归式Transformer框架中,引入翻转增强对性能的影响如何,相较于基于热力图的范式有何差异?
  • RQ5解码器中的基于查询的注意力机制是否能自然地为特定关键点类别实现专一化?这与空间注意力模式有何关联?

主要发现

  • PRTR采用两阶段级联设计,在COCO val2017上达到73.2%的AP,优于其他回归方法,并接近基于热力图的最先进水平。
  • 在推理阶段排除背景类别的logits可使AP提升0.9–1.5个百分点,表明背景干扰会降低匹配质量。
  • 翻转测试能持续提升性能,且由于处于连续坐标空间,不会出现类似基于热力图模型中的对齐错误。
  • Oracle实验表明,若将预测的人员边界框替换为真实边界框,AP可提升2.0–2.5个百分点,表明人员检测模块仍有改进空间。
  • 可视化结果显示,89号查询中92.3%的预测为鼻部关键点,证明了对特定关键点类别的强查询专一化。
  • 查询预测从随机初始位置开始,随解码器各层逐步演化为更精确的位置,若初始位置已接近真实值,则变化极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。