Skip to main content
QUICK REVIEW

[論文レビュー] Graph Stacked Hourglass Networks for 3D Human Pose Estimation

Tianhan Xu, Wataru Takano|arXiv (Cornell University)|Mar 30, 2021
Human Pose and Action Recognition参考文献 51被引用数 14
ひとこと要約

本稿では、骨格プーリングとアンプーリングを用いて階層的な人間の骨格表現間でマルチスケール特徴抽出を可能にする、2Dから3Dの人体ポーズ推定のための新規GCNアーキテクチャ「Graph Stacked Hourglass Networks (GraphSH)」を提案する。残差接続とスケール・エクスパジション・ブロックを統合することで、マルチレベル特徴を統合し、Human3.6Mで80.1% PCKおよび45.8% AUCを達成し、SOTAの性能を実現するとともに、MPI-INF-3DHPへの強い汎化性能を示した。

ABSTRACT

In this paper, we propose a novel graph convolutional network architecture, Graph Stacked Hourglass Networks, for 2D-to-3D human pose estimation tasks. The proposed architecture consists of repeated encoder-decoder, in which graph-structured features are processed across three different scales of human skeletal representations. This multi-scale architecture enables the model to learn both local and global feature representations, which are critical for 3D human pose estimation. We also introduce a multi-level feature learning approach using different-depth intermediate features and show the performance improvements that result from exploiting multi-scale, multi-level feature representations. Extensive experiments are conducted to validate our approach, and the results show that our model outperforms the state-of-the-art.

研究の動機と目的

  • 既存のGCNベースのモデルが単一スケール処理に起因する局所的およびグローバルな空間的特徴を捉える能力に限界を示すことに対処する。
  • 標準のスタックド残差ネットワークにおける浅い特徴表現を、複数の深さにおける中間特徴を統合することによって克服する。
  • スケール間で骨格トポロジーを保持するグラフ固有のプーリングおよびアンプーリング機構を設計する。
  • 特定のGCNレイヤーに依存せずに、3D人体ポーズ推定のための特徴表現力を高める汎用性の高いアーキテクチャを開発する。

提案手法

  • 本アーキテクチャは、3つの階層的スケール(16、8、4関節)における骨格特徴を処理するため、繰り返し適用されるエンコーダ-デコーダ構造とグラフ畳み込み層を用いる。
  • 骨格プーリングは、関節ペア(例:左/右肢)をマックスプールによって統合することでグラフ解像度を低下させ、構造的意味を保持する。
  • 骨格アンプーリングは、低スケールの関節に対応する高スケールの対応関節に特徴を複製することでグラフをアップサンプリングする。
  • 対応するスケール間で残差スキップ接続を適用し、学習の安定化と勾配の流れの改善を図る。
  • 全深さからの中間特徴を連結し、スケール・エクスパジション(SE)ブロックを介して特徴の重要度を再キャリブレーションする。
  • 最終出力は1×1畳み込み層によって生成され、モデル全体がエンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール骨格表現をサポートするグラフベースのアバター・アーキテクチャが、3D人体ポーズ推定の精度を向上させることができるか?
  • RQ2ネットワークの深さにわたるマルチレベル特徴統合は、GCNベースの3Dポーズ推定における性能にどのように影響するか?
  • RQ3骨格プーリングおよびアンプーリング操作は、不規則なグラフデータ上で効果的なマルチスケール特徴学習を可能にしつつ、構造的一致性を保持できるか?
  • RQ4提案されたGraph Stacked Hourglass設計は、先行のGCNベースのモデルと比較して、未知のデータセットへの汎化性能が優れているか?
  • RQ5SEブロックがグラフアーキテクチャ内でマルチレベル特徴を再キャリブレーションすることで、性能向上にどの程度寄与するか?

主な発見

  • 提案されたGraphSHモデルは、CPNで検出された2D関節点を入力として使用した場合、Human3.6Mデータセットで81.5% PCKおよび45.8% AUCを達成し、先行のSOTA手法を上回った。
  • 真値の2Dキーポイントを入力とした場合、81.7% PCKおよび45.8% AUCに達し、入力品質に頑健であり、理想状態でも優れた性能を示した。
  • モデルは未知データに対して良好に汎化され、Human3.6Mでのみ学習したにもかかわらず、MPI-INF-3DHPテストセットで最高の性能を記録した。
  • アブレーションスタディの結果、マルチスケールおよびマルチレベル特徴が両方とも不可欠であることが確認され、SEブロックおよび残差接続が性能向上に顕著な寄与を示した。
  • モデルはわずか370万パラメータで構成されており、2番目に優れた手法(438万パラメータ)よりも少ないため、パラメータ効率が高く、より優れた特徴表現能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。