Skip to main content
QUICK REVIEW

[論文レビュー] 3D Human Pose Estimation with Spatial and Temporal Transformers

Ce Zheng, Sijie Zhu|arXiv (Cornell University)|Mar 18, 2021
Human Pose and Action Recognition被引用数 4
ひとこと要約

この論文では、2Dビデオシーケンスからの3次元人体ポーズ推定のための純トランスフォーマー型モデルであるPoseFormerを提案する。空間的および時間的トランスフォーマー・モジュールを別々に用いて、フレーム内での関節関係とフレーム間の長距離時間的依存関係をモデル化する。Human3.6MおよびMPI-INF-3DHPで最先端の性能を達成し、特に小規模なデータセットで微調整した場合に、精度と一般化性能が向上している。

ABSTRACT

Transformer architectures have become the model of choice in natural language processing and are now being introduced into computer vision tasks such as image classification, object detection, and semantic segmentation. However, in the field of human pose estimation, convolutional architectures still remain dominant. In this work, we present PoseFormer, a purely transformer-based approach for 3D human pose estimation in videos without convolutional architectures involved. Inspired by recent developments in vision transformers, we design a spatial-temporal transformer structure to comprehensively model the human joint relations within each frame as well as the temporal correlations across frames, then output an accurate 3D human pose of the center frame. We quantitatively and qualitatively evaluate our method on two popular and standard benchmark datasets: Human3.6M and MPI-INF-3DHP. Extensive experiments show that PoseFormer achieves state-of-the-art performance on both datasets. Code is available at \url{https://github.com/zczcwh/PoseFormer}

研究の動機と目的

  • 3次元人体ポーズ推定における畳み込みネットワークの長距離時間的依存関係および空間的関節関係のモデル化の限界を解消すること。
  • 2Dから3Dへのラiftingに、純トランスフォーマー・アーキテクチャの実現可能性と有効性を検討すること。
  • 長時間の入力シーケンスに対しても、パラメータの増加と計算コストの増加を抑えるモデル設計をすること。
  • 標準ベンチマーク、特に小規模データセット上でのモデルの性能と一般化能力を評価すること。
  • アテンションマップの分析を通じて、モデルが空間的および時間的依存関係をどのように捉えているかを理解すること。

提案手法

  • PoseFormerは、各フレームごとの2D関節座標を処理する空間的トランスフォーマー・モジュールを用い、学習可能な位置埋め込みを用いた多頭注目機構により、関節間の局所的関係をモデル化する。
  • 空間的トランスフォーマーは、各フレームごとに空間構造と関節関係を保持する潜在特徴表現を出力する。
  • 時間的トランスフォーマー・モジュールは、これらの空間的特徴をフレーム単位の特徴のシーケンスとして処理し、時間的特徴のシーケンス全体にわたる自己注意機構により、長距離時間的依存関係を捉える。
  • 各フレームの2Dポーズを17個の関節トークンのシーケンスとして扱い、空間的および時間的次元に位置埋め込みを適用することで、空間的および時間的順序を保持する。
  • 最終的な3次元ポーズは、時間的トランスフォーマーの出力を注目する学習可能なクエリ・ベクトルを用いて、中央フレームに対して予測する。
  • モデルは、畳み込み層を一切含まず、3次元関節座標の標準回帰損失を用いてエンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1純トランスフォーマー・アーキテクチャは、2Dビデオシーケンスからの3次元人体ポーズ推定において、畳み込みベースラインを上回ることができるか?
  • RQ2空間的・時間的トランスフォーマー設計は、局所的関節関係と長距離時間的依存関係を同時に効果的にモデル化できるか?
  • RQ3大規模データで事前学習した後、小規模データセットに微調整した場合に、提案アーキテクチャは良好な一般化性能を示すか?
  • RQ4空間的および時間的トランスフォーマー内のアテンションマップは、意味的な人体構造や運動パターンをどのように反映しているか?
  • RQ5長時間シーケンスにおける3次元ポーズ推定において、モデルの複雑さ、推論速度、精度のトレードオフはいかなるものか?

主な発見

  • PoseFormerは、Human3.6Mデータセットで最先端の性能を達成し、MPJPE(1関節あたりの位置誤差の平均)の観点で、以前の手法を上回っている。
  • MPI-INF-3DHPデータセットでは、比較されたすべての手法の中で最低のMPJPEを達成しており、強力な一般化性能とロバストネスを示している。
  • 長時間の入力シーケンスを用いることで、精度が向上しており、長距離時間的依存関係の有効なモデル化が示されている。
  • 小規模なHumanEvaデータセットで微調整した場合、顕著な性能向上が得られ、大規模データでの事前学習からの強力な一般化能力が確認された。
  • アテンション可視化により、空間的トランスフォーマーが意味的な関節グループ(例:左腕/右腕)を学習していることが明らかになった。また、時間的トランスフォーマーは、離れたフレーム間の長距離運動パターンを捉えている。
  • 推論速度が最も速いとは限らないが、2Dポーズ検出器と組み合わせた場合、全体の3次元HPEパイプラインのボトルネックとはならず、推論時間は許容範囲内に保たれている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。