Skip to main content
QUICK REVIEW

[论文解读] Graph Stacked Hourglass Networks for 3D Human Pose Estimation

Tianhan Xu, Wataru Takano|arXiv (Cornell University)|Mar 30, 2021
Human Pose and Action Recognition参考文献 51被引用 14
一句话总结

本文提出图堆叠沙漏网络(GraphSH),一种用于2D到3D人体姿态估计的新型图卷积网络(GCN)架构,通过骨骼池化与反池化操作,在分层人体骨骼表示中实现多尺度特征学习,同时利用残差连接与挤压-激励模块整合多级特征,实现SOTA性能:在Human3.6M数据集上达到80.1% PCK与45.8% AUC,并展现出对MPI-INF-3DHP数据集的强泛化能力。

ABSTRACT

In this paper, we propose a novel graph convolutional network architecture, Graph Stacked Hourglass Networks, for 2D-to-3D human pose estimation tasks. The proposed architecture consists of repeated encoder-decoder, in which graph-structured features are processed across three different scales of human skeletal representations. This multi-scale architecture enables the model to learn both local and global feature representations, which are critical for 3D human pose estimation. We also introduce a multi-level feature learning approach using different-depth intermediate features and show the performance improvements that result from exploiting multi-scale, multi-level feature representations. Extensive experiments are conducted to validate our approach, and the results show that our model outperforms the state-of-the-art.

研究动机与目标

  • 为解决现有基于GCN的模型在单尺度处理下难以同时捕捉局部与全局空间特征的局限性。
  • 通过在多个深度层级引入中间特征,克服标准堆叠残差网络中特征表示浅层的问题。
  • 设计一种图专用的池化与反池化机制,以在不同尺度间保持骨骼拓扑结构的一致性。
  • 开发一种可泛化的架构,增强3D人体姿态估计的特征表达能力,且不依赖特定GCN层。

提出的方法

  • 该架构采用重复的编码器-解码器结构,结合图卷积层,在三个分层尺度(16、8和4个关节)上处理骨骼特征。
  • 骨骼池化通过最大池化操作合并关节对(如左右肢体)来降低图分辨率,同时保留结构语义。
  • 骨骼反池化通过将低尺度关节的特征复制到其对应高尺度对应物上,实现图的上采样。
  • 在对应尺度之间应用残差跳跃连接,以稳定训练并改善梯度流动。
  • 将所有深度的中间特征拼接后输入挤压-激励(SE)模块,以重新校准特征重要性。
  • 最终输出通过1×1卷积层生成,整个模型以端到端方式训练。

实验结果

研究问题

  • RQ1基于图的沙漏架构若支持多尺度骨骼表示,是否能提升3D人体姿态估计的准确性?
  • RQ2在网络深度上进行多级特征整合,对基于GCN的3D姿态估计性能有何影响?
  • RQ3骨骼池化与反池化操作是否能在保持结构一致性的同时,有效实现对不规则图数据的多尺度特征学习?
  • RQ4与先前的基于GCN的模型相比,所提出的图堆叠沙漏设计是否具有更好的泛化能力?
  • RQ5SE模块在重新校准图架构中的多级特征方面,能在多大程度上提升性能?

主要发现

  • 所提出的GraphSH模型在Human3.6M数据集上使用CPN检测的2D关节点时,达到81.5% PCK与45.8% AUC,优于先前SOTA方法。
  • 在使用真实2D关键点时,模型达到81.7% PCK与45.8% AUC,表明对输入质量具有鲁棒性,并在理想条件下表现优异。
  • 该模型在未见数据上泛化良好,在仅在Human3.6M上训练的情况下,于MPI-INF-3DHP测试集上取得最佳性能。
  • 消融实验证实,多尺度与多级特征均至关重要,SE模块与残差连接对性能提升贡献显著。
  • 该模型仅使用370万个参数,少于第二好的方法(438万个),表明其具有更高的参数效率与更优的特征表示能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。