[論文レビュー] MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video
MixSTEは、関節ごとの時間的動きを個別にモデル化する関節分離戦略を用い、空間的および時間的トランスフォーマーブロックを交互に適用することで、空間時間的整合性を向上させる、3次元人体ポーズ推定のための新しいseq2seqトランスフォーマーベースアーキテクチャを提案する。この手法は、先行手法と比較してベンチマークデータセット上でMPJPEを7.6%低減し、P-MPJPEを10.9%低減する最先端の性能を達成した。
Recent transformer-based solutions have been introduced to estimate 3D human pose from 2D keypoint sequence by considering body joints among all frames globally to learn spatio-temporal correlation. We observe that the motions of different joints differ significantly. However, the previous methods cannot efficiently model the solid inter-frame correspondence of each joint, leading to insufficient learning of spatial-temporal correlation. We propose MixSTE (Mixed Spatio-Temporal Encoder), which has a temporal transformer block to separately model the temporal motion of each joint and a spatial transformer block to learn inter-joint spatial correlation. These two blocks are utilized alternately to obtain better spatio-temporal feature encoding. In addition, the network output is extended from the central frame to entire frames of the input video, thereby improving the coherence between the input and output sequences. Extensive experiments are conducted on three benchmarks (Human3.6M, MPI-INF-3DHP, and HumanEva). The results show that our model outperforms the state-of-the-art approach by 10.9% P-MPJPE and 7.6% MPJPE. The code is available at https://github.com/JinluZhang1126/MixSTE.
研究の動機と目的
- フレーム間における個々のボディ関節の異なる動き軌跡をモデル化する既存手法の限界を解消すること。
- 出力を単一の中央フレームから全入力シーケンスに拡張することで、3次元ポーズ推定におけるシーケンスの整合性を向上させること。
- 重複するシーケンスに対する繰り返し推論を避けるseq2seq学習パラダイムを採用することで、推論効率を向上させ、冗長性を低減すること。
- 長時間のシーケンスにおいても高い精度と時間的滑らかさを維持しながら、柔軟な入力シーケンス長を可能にすること。
- 混合空間時間的トランスフォーマーエンコーダーを用いた、新しい効率的で正確な3次元人体ポーズ推定のベースラインを提供すること。
提案手法
- 各2次元キーポイントを個別のトークンとして扱うことで、関節ごとの時間的動き学習が可能となり、時間ドメインにおける特徴次元を低減する。
- 空間的および時間的トランスフォーマーブロックを交互に配置することで、段階的にグローバルな空間時間的表現を構築する。
- 混合空間時間的エンコーダー(MixSTE)は、スタックされたトランスフォーマーレイヤーを用いて、関節間の空間的相関と個々の関節の時間的ダイナミクスを統合する。
- 重み付きMPJPE損失(精度のため)、時間的整合性損失(TCLoss)、およびMPJVE損失(滑らかさのため)を組み合わせたマルチ損失目的関数で学習を行う。
- 任意長の入力シーケンスをサポートし、全3次元ポーズシーケンスを出力することで、時間的整合性を向上させ、冗長な計算を削減する。
- エンドツーエンドで学習可能であり、自己注意機構を活用してフレームおよび関節間の長距離依存関係をモデル化する。
実験結果
リサーチクエスチョン
- RQ1個々の関節の動き軌跡を別々にモデル化することで、長時間の動画シーケンスにおける3次元ポーズ推定の精度が向上するか?
- RQ2seq2seqトランスフォーマーアーキテクチャは、seq2frameアプローチと比較して、精度、滑らかさ、推論効率の観点でどのように異なるか?
- RQ3空間的および時間的アテンションブロックを交互に配置することで、3次元ポーズ推定における空間時間的特徴学習がどの程度向上するか?
- RQ43次元ポーズシーケンス予測において、精度と時間的滑らかさのバランスを取るために最も効果的な損失関数は何か?
- RQ5混合空間時間的トランスフォーマーエンコーダーは、性能の劣化を伴わずに、多様な入力シーケンス長に一般化可能か?
主な発見
- MixSTEは、プロトコル1におけるHuman3.6Mで40.9 mmのMPJPEを達成し、以前のSOTA手法と比較して7.6%の改善を示した。
- P-MPJPEは前回SOTAと比較して10.9%低減され、長時間シーケンスにおける優れた精度を示した。
- 243フレームの入力シーケンスを用いた場合、MixSTEは40.9 mmのMPJPEと2.3 mmのMPJVEを達成し、優れた時間的滑らかさを示した。
- アブレーションスタディの結果、WMPJPE損失、TCLoss、MPJVE損失の組み合わせが最良の性能を示し、MPJVEが2.3 mm低下した。
- 高い効率性を維持しており、全シーケンス出力と冗長性の低減により、seq2frameベースラインよりも高速な推論が可能だった。
- ハイパーパramータのアブレーションでは、深さ8、モデル次元512、入力長243が、最小限のパラメータ増加で最適なパフォーマンスを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。