Skip to main content
QUICK REVIEW

[论文解读] 3D Human Pose Estimation with Spatial and Temporal Transformers

Ce Zheng, Sijie Zhu|arXiv (Cornell University)|Mar 18, 2021
Human Pose and Action Recognition被引用 4
一句话总结

本文提出PoseFormer,一种基于纯Transformer的模型,用于从2D视频序列中进行3D人体姿态估计,通过独立的空间与时间Transformer模块分别建模帧内关节点关系和帧间长程时间依赖。该方法在Human3.6M和MPI-INF-3DHP数据集上实现了最先进性能,准确率与泛化能力均得到提升,尤其在微调较小数据集时表现显著。

ABSTRACT

Transformer architectures have become the model of choice in natural language processing and are now being introduced into computer vision tasks such as image classification, object detection, and semantic segmentation. However, in the field of human pose estimation, convolutional architectures still remain dominant. In this work, we present PoseFormer, a purely transformer-based approach for 3D human pose estimation in videos without convolutional architectures involved. Inspired by recent developments in vision transformers, we design a spatial-temporal transformer structure to comprehensively model the human joint relations within each frame as well as the temporal correlations across frames, then output an accurate 3D human pose of the center frame. We quantitatively and qualitatively evaluate our method on two popular and standard benchmark datasets: Human3.6M and MPI-INF-3DHP. Extensive experiments show that PoseFormer achieves state-of-the-art performance on both datasets. Code is available at \url{https://github.com/zczcwh/PoseFormer}

研究动机与目标

  • 解决卷积神经网络在3D人体姿态估计中建模长程时间依赖与关节点空间关系的局限性。
  • 探索纯Transformer架构在基于视频的3D姿态估计中从2D到3D提升任务的可行性和有效性。
  • 设计一种在长输入序列下仍保持低参数增长与计算成本的模型。
  • 在标准基准数据集(包括小规模数据集)上评估模型的性能与泛化能力。
  • 通过注意力图分析,理解模型如何捕捉空间与时间依赖关系。

提出的方法

  • PoseFormer使用空间Transformer模块处理每帧的2D关节点坐标,通过多头自注意力机制与可学习位置嵌入,建模关节点间的局部关系。
  • 空间Transformer为每帧输出一个潜在特征表示,保留空间结构与关节点关系。
  • 时间Transformer模块随后处理这些帧级特征表示,通过序列上特征的自注意力机制捕捉长程时间依赖。
  • 模型将每帧的2D姿态视为17个关节点标记的序列,并在空间与时间维度上应用位置嵌入,以保持空间与时间顺序。
  • 通过一个可学习查询向量,关注时间Transformer的输出,预测中心帧的3D姿态。
  • 模型采用标准回归损失在3D关节点坐标上进行端到端训练,全程不使用任何卷积层。

实验结果

研究问题

  • RQ1纯Transformer架构是否能在从2D视频序列进行3D人体姿态估计的任务中超越卷积基线模型?
  • RQ2所提出的时空Transformer设计能否同时有效建模关节点的局部关系与长程时间依赖?
  • RQ3当在大规模数据上预训练后,该架构在小规模数据集上是否具备良好的泛化能力?
  • RQ4空间与时间Transformer中的注意力图是否能反映有意义的人体结构与运动模式?
  • RQ5在长序列3D姿态估计中,模型复杂度、推理速度与准确率之间存在何种权衡?

主要发现

  • PoseFormer在Human3.6M数据集上达到最先进性能,MPJPE(关节点位置误差均值)优于此前所有方法。
  • 在MPI-INF-3DHP数据集上,PoseFormer在所有对比方法中取得最低的MPJPE,展现出强大的泛化能力与鲁棒性。
  • 模型在更长输入序列下表现出更高的准确率,表明其有效建模了长程时间依赖。
  • 在较小的HumanEva数据集上进行微调后,PoseFormer实现显著性能提升,证实了大规模预训练带来的强大泛化能力。
  • 注意力可视化显示,空间Transformer学习到了有意义的关节点分组(如左右肢体),时间Transformer则捕捉到跨远距离帧的长程运动模式。
  • 尽管推理速度并非最快,但PoseFormer的推理时间仍可接受,与2D姿态检测器结合时不会成为整体3D人体姿态估计流程的瓶颈。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。