Skip to main content
QUICK REVIEW

[論文レビュー] MotionAGFormer: Enhancing 3D Human Pose Estimation with a Transformer-GCNFormer Network

Soroush Mehraban, Vida Adeli|arXiv (Cornell University)|Oct 25, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

MotionAGFormerは、変換器から得られる長距離相関を活かし、専用のGCNFormerモジュールを介して局所的な空間時間的関節関係を統合することで、3次元人体ポーズ推定を向上させる画期的なハイブリッド変換器-GCNFormerアーキテクチャを提案する。並列処理を行う両ストリームの適応的融合により、Human3.6Mでは38.4 mmのP1誤差、MPI-INF-3DHPでは16.2 mmのP1誤差という最先端性能を達成した。また、従来の最先端モデルと比較して25%少ないパラメータ数で、計算コストは3倍も効率的である。

ABSTRACT

Recent transformer-based approaches have demonstrated excellent performance in 3D human pose estimation. However, they have a holistic view and by encoding global relationships between all the joints, they do not capture the local dependencies precisely. In this paper, we present a novel Attention-GCNFormer (AGFormer) block that divides the number of channels by using two parallel transformer and GCNFormer streams. Our proposed GCNFormer module exploits the local relationship between adjacent joints, outputting a new representation that is complementary to the transformer output. By fusing these two representation in an adaptive way, AGFormer exhibits the ability to better learn the underlying 3D structure. By stacking multiple AGFormer blocks, we propose MotionAGFormer in four different variants, which can be chosen based on the speed-accuracy trade-off. We evaluate our model on two popular benchmark datasets: Human3.6M and MPI-INF-3DHP. MotionAGFormer-B achieves state-of-the-art results, with P1 errors of 38.4mm and 16.2mm, respectively. Remarkably, it uses a quarter of the parameters and is three times more computationally efficient than the previous leading model on Human3.6M dataset. Code and models are available at https://github.com/TaatiTeam/MotionAGFormer.

研究の動機と目的

  • 標準的な変換器が3次元人体ポーズ系列における局所的関節依存関係を捉える能力に限界があることに対処すること。
  • グラフ畳み込みネットワーク(GCNs)の局所的インダクティブバイアスとグローバルなアテンション機構を統合することで、3次元ポーズ推定の精度を向上させること。
  • 実世界のデプロイに適した、速度と精度のバランスを取った計算効率的で柔軟なアーキテクチャを開発すること。
  • 1フレームずつではなく、1回の順伝播で全3次元ポーズ系列を予測することで、冗長な計算を排除すること。
  • 人間の運動構造のモデリングを向上させるために、グローバルおよび局所的表現の適応的統合を可能にすること。

提案手法

  • 関節特徴を2つの並列ストリームで処理するAttention-GCNFormer(AGFormer)ブロックを提案。1つはグローバルなコンテキストを処理する標準的な変換器、もう1つは局所的な空間時間的関係を処理するGCNFormer。
  • 局所的関節依存関係を学習可能な時間的隣接行列を用いてモデル化するGCNFormerモジュールを導入し、運動学的構造の表現を向上させる。
  • 変換器とGCNFormerストリーム間の適応的特徴統合を採用し、学習可能な統合重みを用いずにグローバルおよび局所的インダクティブバイアスのバランスを取る。
  • モデルの収束性と性能を向上させるために時間的位置埋め込みを採用し、空間的または組み合わせ埋め込みよりも優れた性能を示す。
  • 深さとチャネル幅を調整することで4種類のバリエーションを持つMotionAGFormerを設計し、速度と精度のトレードオフを可能にする。
  • 全3次元系列を入力2次元フレームから1回の順伝播で回帰する単一順伝播推論戦略を採用し、冗長性を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1変換器とGCNを組み合わせたハイブリッドアーキテクチャは、単独のモデルよりも3次元人体ポーズ推定を向上させることができるか?
  • RQ2局所的GCNベースのモデリングとグローバル自己アテンションの統合は、人間の運動構造モデリングをどのように向上させるか?
  • RQ33次元ポーズ推定におけるグローバルおよび局所的表現の最適な統合戦略は何か?
  • RQ4軽量なアーキテクチャは、計算コストとモデルサイズを削減しながらも最先端の性能を達成できるか?
  • RQ5時間的位置埋め込みの使用は、3次元ポーズリフトの系列ベース推論における収束性と精度を向上させるか?

主な発見

  • MotionAGFormer-Bは、Human3.6Mデータセットで38.4 mmのP1誤差を達成し、新たな最先端性能を記録した。
  • MPI-INF-3DHPデータセットでは、16.2 mmのP1誤差を達成し、ベンチマーク間での強い汎化性能を示した。
  • 従来の最良モデルと比較して、パラメータ数は25%にまで削減され、計算コストは3倍も効率的である。
  • アブレーションスタディの結果、変換器とGCNFormerストリームの並列統合が最良の性能(38.4 mm P1)を達成し、逐次統合や個別のモジュールよりも優れていることが確認された。
  • 時間的位置埋め込みは誤差を0.88 mmにまで低減させ、収束を加速した。一方、空間的埋め込みのみでは0.94 mmの誤差を示した。
  • GCNFormerモジュール単体では57.5 mmのP1誤差を達成したため、最適な結果を得るには局所的およびグローバルモデリングの統合が必要であることが明確になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。