Skip to main content
QUICK REVIEW

[論文レビュー] P-STMO: Pre-Trained Spatial Temporal Many-to-One Model for 3D Human Pose Estimation

Wenkang Shan, Zhenhua Liu|arXiv (Cornell University)|Mar 15, 2022
Human Pose and Action Recognition被引用数 6
ひとこと要約

本論文は、2次元から3次元人体ポーズ推定のための事前学習済み空間時系列多対一モデルP-STMOを提案する。2段階のフレームワークを採用:まず自己教師付きマスクポーズモデリング(MPM)による事前学習で空間時系列的依存関係を捉え、次に多対一フレームアグリゲーターを用いた微調整を行う。本手法は、CPNから得られる2次元ポーズのみを用いて、Human3.6Mで42.1mmのMPJPEを達成し、最先端性能を発揮するとともに、先行手法と比較して計算コストを1.5–7.1倍まで低減した。

ABSTRACT

This paper introduces a novel Pre-trained Spatial Temporal Many-to-One (P-STMO) model for 2D-to-3D human pose estimation task. To reduce the difficulty of capturing spatial and temporal information, we divide this task into two stages: pre-training (Stage I) and fine-tuning (Stage II). In Stage I, a self-supervised pre-training sub-task, termed masked pose modeling, is proposed. The human joints in the input sequence are randomly masked in both spatial and temporal domains. A general form of denoising auto-encoder is exploited to recover the original 2D poses and the encoder is capable of capturing spatial and temporal dependencies in this way. In Stage II, the pre-trained encoder is loaded to STMO model and fine-tuned. The encoder is followed by a many-to-one frame aggregator to predict the 3D pose in the current frame. Especially, an MLP block is utilized as the spatial feature extractor in STMO, which yields better performance than other methods. In addition, a temporal downsampling strategy is proposed to diminish data redundancy. Extensive experiments on two benchmarks show that our method outperforms state-of-the-art methods with fewer parameters and less computational overhead. For example, our P-STMO model achieves 42.1mm MPJPE on Human3.6M dataset when using 2D poses from CPN as inputs. Meanwhile, it brings a 1.5-7.1 times speedup to state-of-the-art methods. Code is available at https://github.com/paTRICK-swk/P-STMO.

研究の動機と目的

  • 2次元から3次元へのポーズ推定の不適切な性質(深度の曖昧さ)と、1段階学習設定下での空間時系列的依存関係の学習の難しさに対処する。
  • 事前学習と微調整の2段階学習パラダイムを導入することで、最適化の難易度を軽減し、一般化性能を向上させる。
  • 自然言語処理とコンピュータビジョンの成功事例にインspiredされ、3次元回帰の前段階として、2次元ポーズ系列の頑健な表現を自己教師付き事前学習で学ぶ。
  • 時間的ダウンサンプリング戦略とMLPベースの空間エンコーダーを導入することで、冗長性と計算オーバーヘッドを低減し、効率性と性能を向上させる。
  • ノイズの多い入力や未観測のカメラビュー下での、事前学習戦略の頑健性と一般化性能を検証する。

提案手法

  • 2段階のフレームワークを提案:段階Iでは自己教師付きマスクポーズモデリング(MPM)による事前学習を実施し、空間的および時間的ドメインでランダムにフレームと関節をマスクする。
  • MPMタスクは、元の2次元ポーズ系列を再構築することを目的としたノイズ除去オートエンコーダーの目的関数を用い、エンコーダーが内在的な空間時系列的依存関係を学習できるようにする。
  • 段階IIでは、事前学習済みエンコーダーをSTMOアーキテクチャ内で微調整する。STMOアーキテクチャには、空間符号化モジュール(SEM)、時間符号化モジュール(TEM)、多対一フレームアグリゲーター(MOFA)が含まれる。
  • SEMはMLPブロックを空間特徴抽出に用い、この文脈では全結合層やTransformerよりも優れた性能を発揮しながら、中程度の計算コストを維持する。
  • データの冗長性を低減し、モデルの複雑さを増さずに時間的受容場を拡大するために、時間的ダウンサンプリング戦略(TDS)を適用する。
  • MOFAモジュールはTransformerベースのアーキテクチャ(STE)を用い、複数フレームからの特徴をアグリゲートして現在のフレームの3次元ポーズを予測する。多ヘッドアテンションマップの可視化により、機能的特化が確認された。

実験結果

リサーチクエスチョン

  • RQ1マスクされた2次元ポーズ系列に対する自己教師付き事前学習は、3次元人体ポーズ推定モデルの性能と一般化性能を向上させることができるか?
  • RQ2事前学習 followed by 微調整という2段階学習戦略は、2次元から3次元へのポーズ推定における最適化の難易度を軽減し、収束を改善するか?
  • RQ3MLPベースの空間エンコーダーは、2次元ポーズ系列内のフレーム内空間関係を捉える際に、全結合層やTransformerを上回る性能を発揮するか?
  • RQ4提案された時間的ダウンサンプリング戦略は、冗長性を低減しつつ、長距離の時間的依存関係を保持するのにどの程度効果的か?
  • RQ5事前学習は、ノイズの多い2次元キーポイント入力や、未観測のカメラビューといったドメインシフトに対して、どの程度の頑健性を向上させるか?

主な発見

  • P-STMOは、CPNから得られる2次元ポーズのみを用いて、Human3.6Mデータセットで42.1mmのMPJPEを達成し、パラメータ数が少なく、計算オーバーヘッドも低い先行SOTA手法を上回った。
  • 先行SOTA手法と比較して1.5–7.1倍の高速化を達成し、顕著な効率性の向上を示した。
  • 事前学習により頑健性が向上:ガウスノイズ(σ = 0.05)条件下で、非事前学習ベースラインと比較してMPJPEが2.0%低減した。
  • 未観測のカメラビューに対しても良好な一般化性能を示した:カメラ0,1,2で事前学習し、カメラ3でテストした場合、44.4mmのMPJPEを達成し、非事前学習バージョン(45.2mm)を上回った。
  • アテンション可視化により、段階IIのTEMが局所的(例:頭部0)およびグローバル的(例:頭部5)なパターンを学習していることが確認された。一方、MOFAは現在のフレームおよびその近隣フレームに注目する傾向を示した。
  • 入力フレームのランダムシャッフルは性能を著しく低下させるが、事前学習によりこの性能低下が非事前学習ベースラインと比較して2.9%軽減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。