Skip to main content
QUICK REVIEW

[論文レビュー] GraFormer: Graph Convolution Transformer for 3D Pose Estimation

Weixi Zhao, Yunjie Tian|arXiv (Cornell University)|Sep 17, 2021
Human Pose and Action Recognition参考文献 37被引用数 16
ひとこと要約

GraFormerは、3次元人体ポーズ推定のための新しいトランスフォーマー基盤アーキテクチャを提案する。自己注意機構と学習可能な隣接行列を用いたグラフ畳み込み(LAM-Gconv)およびチェビシェフ型グラフ畳み込み(ChebGConv)を組み合わせ、グローバルな関節関係と高次構造的依存関係の両方を活用する。Human3.6Mでパラメータ数を18%削減しながら最先端性能を達成し、15のカテゴリーのうち13で新記録を樹立した。

ABSTRACT

Exploiting relations among 2D joints plays a crucial role yet remains semi-developed in 2D-to-3D pose estimation. To alleviate this issue, we propose GraFormer, a novel transformer architecture combined with graph convolution for 3D pose estimation. The proposed GraFormer comprises two repeatedly stacked core modules, GraAttention and ChebGConv block. GraAttention enables all 2D joints to interact in global receptive field without weakening the graph structure information of joints, which introduces vital features for later modules. Unlike vanilla graph convolutions that only model the apparent relationship of joints, ChebGConv block enables 2D joints to interact in the high-order sphere, which formulates their hidden implicit relations. We empirically show the superiority of GraFormer through conducting extensive experiments across popular benchmarks. Specifically, GraFormer outperforms state of the art on Human3.6M dataset while using 18$\%$ parameters. The code is available at https://github.com/Graformer/GraFormer .

研究の動機と目的

  • 従来の手法における2次元関節関係の未利用に起因する受容 field の制限と構造的情報の喪失を是正すること。
  • 2次元関節間のグローバルな相互作用と暗黙の高次関係を効果的に捉えるモデルの開発。
  • 自己注意機構(グローバルな文脈)とグラフ畳み込み(構造的インダクティブバイアス)の長所を、パフォーマンスやパラメータ効率を損なわずに統合すること。
  • 1次結合を超えた関節関係の学習が、3次元ポーズ推定の精度向上に寄与することを実証すること。

提案手法

  • トランスフォーマーのMLPヘッドを置き換えることで、学習可能な隣接行列に基づくグラフ畳み込み(LAM-Gconv)を統合したハイブリッドモジュール「GraAttention」を導入。これにより、グラフ構造を保持しつつグローバルな相互作用を実現する。
  • 2次元関節間の高次関係を、グラフ上で複数ホップにわたって特徴を集約することでモデル化するChebGConvブロックを採用。これにより、1次近隣関係を超えた有効な受容 field を拡大する。
  • GraAttentionとChebGConvブロックをエンコーダー風のアーキテクチャにスタックし、2次元関節座標から段階的に3次元ポーズ予測を精緻化する。
  • LAM-Gconvで使用する学習可能な隣接行列により、トレーニング中に関節関係を動的に適応させ、特徴表現学習の向上を図る。
  • トランスフォーマー内の標準的なMLPをLAM-Gconvに置き換えることで、2次元から3次元への回帰におけるMLP層に起因する性能低下を回避する。
  • グラフラプラシアン行列の可視化により、高次ChebGConv演算がより遠くの関節接続を活性化していることを示し、暗黙の構造的関係を明らかにする。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構とグラフ畳み込みを組み合わせることで、グローバルな文脈と構造的インダクティブバイアスの両方を保持しつつ、3次元ポーズ推定を向上させられるか?
  • RQ2高次グラフ畳み込み(ChebGConv)は、1次結合を超えた暗黙の関節関係をどのように向上させるか?
  • RQ3トランスフォーマーのMLPヘッドをグラフ畳み込み層に置き換えることで、パフォーマンスが向上し、過学習や性能劣化が抑制されるか?
  • RQ4LAM-Gconvにおける学習可能な隣接行列は、固定または学習可能なアテンションオンリーメカニズムと比較して、関節相互作用のモデリングをどの程度向上させるか?
  • RQ5多様なベンチマークにおいて、GraFormerは最先端手法と比較して、精度とパラメータ効率の両面で優れているか?

主な発見

  • GraFormerはHuman3.6Mデータセットで35.17 mmのMPJPEを達成し、パラメータ数がたった0.65Mのわずかで、従来の最先端手法を上回った。
  • GraFormerはHuman3.6Mベンチマークの15のカテゴリーのうち13で1位を獲得し、多様な動作に対して一貫した優位性を示した。
  • アブレーションスタディの結果、GraAttentionやChebGConvブロックを削除すると顕著な性能低下が生じ、両者の重要性が確認された。
  • GraAttentionを標準的な自己注意機構に置き換え、MLPを保持するモデル「Model-AM」は性能が劣化し、12 mm MPJPE未満に収束しなかったのに対し、GraFormerは安定して高い性能を示した。
  • 学習された隣接行列の可視化から、GraFormerが肢体ごとの関節クラスタ(例:2–4、5–7)やレイヤーを跨ぐ長距離関係を効果的に特定していることがわかった。
  • ChebGConvの可視化により、高次ラプラシアン行列がより遠くの関節を活性化していることが確認され、非隣接関係の暗黙のモデリング能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。