Skip to main content
QUICK REVIEW

[論文レビュー] PoseFormerV2: Exploring Frequency Domain for Efficient and Robust 3D Human Pose Estimation

Qitao Zhao, Ce Zheng|arXiv (Cornell University)|Mar 30, 2023
Human Pose and Action Recognition被引用数 6
ひとこと要約

PoseFormerV2 は、離散コサイン変換(DCT)係数を用いた周波数ドメイン表現を導入することで、3次元人体ポーズ推定の効率性とロバスト性を向上させた。時間領域と周波数領域の両方で時間的特徴を統合することで、長時間のシーケンスにおいてもノイズに強く、PoseFormer や他の最先端手法を上回る性能を達成し、Human3.6M および MPI-INF-3DHP で優れたスピード・アキュラシーのトレードオフを実現した。

ABSTRACT

Recently, transformer-based methods have gained significant success in sequential 2D-to-3D lifting human pose estimation. As a pioneering work, PoseFormer captures spatial relations of human joints in each video frame and human dynamics across frames with cascaded transformer layers and has achieved impressive performance. However, in real scenarios, the performance of PoseFormer and its follow-ups is limited by two factors: (a) The length of the input joint sequence; (b) The quality of 2D joint detection. Existing methods typically apply self-attention to all frames of the input sequence, causing a huge computational burden when the frame number is increased to obtain advanced estimation accuracy, and they are not robust to noise naturally brought by the limited capability of 2D joint detectors. In this paper, we propose PoseFormerV2, which exploits a compact representation of lengthy skeleton sequences in the frequency domain to efficiently scale up the receptive field and boost robustness to noisy 2D joint detection. With minimum modifications to PoseFormer, the proposed method effectively fuses features both in the time domain and frequency domain, enjoying a better speed-accuracy trade-off than its precursor. Extensive experiments on two benchmark datasets (i.e., Human3.6M and MPI-INF-3DHP) demonstrate that the proposed approach significantly outperforms the original PoseFormer and other transformer-based variants. Code is released at \url{https://github.com/QitaoZhao/PoseFormerV2}.

研究の動機と目的

  • 変換器ベースの3次元ポーズ推定における長大な2次元スケルトンシーケンス処理の高コストを低減すること。
  • CPN などの実世界の検出器から得られるノイズの多い2次元関節検出に耐性を持つこと。
  • 推論時間および学習時間を著しく短縮しつつ、精度を維持または向上させること。
  • 周波数ドメイン表現(DCT)を用いて、コンactなグローバルなシーケンス表現を導入し、モデルの一般化性能を向上させること。
  • アーキテクチャの大幅な見直しを伴わず、PoseFormer や他の既存モデルとの互換性を保ちつつ、より優れたスピード・アキュラシーのトレードオフを達成すること。

提案手法

  • 入力の2次元関節シーケンスに離散コサイン変換(DCT)を適用し、コンパクトでグローバルな表現として低周波数係数を抽出する。
  • シーケンス長と計算負荷を低減するため、中心部のDCT係数(例:9× または 27× 受信フィールド拡張)のみを保持する。
  • 時間領域(元のシーケンス)と周波数領域(DCT係数)からの特徴を二重ブランチの変換器エンコーダーで統合する。
  • PoseFormer の空間的および時間的エンコーダーに周波数ドメイン表現を最小限のアーキテクチャ変更で統合する。
  • 周波数表現における空間的および時間的構造を保持するため、学習可能なトークン化および位置エンコーディング方式を採用する。
  • 二段階設計を採用:まず、各フレームの関節トークンに対する空間的自己注意;次に、周波数ドメイン特徴で強化されたフレームトークンに対する時間的自己注意。

実験結果

リサーチクエスチョン

  • RQ1DCTによる周波数ドメイン表現は、変換器ベースの3次元人体ポーズ推定の効率性とロバスト性を向上させ得るか?
  • RQ2全長シーケンスと比較して、低周波数DCT係数の部分集合のみを用いることで、性能と計算コストにどのような影響があるか?
  • RQ3周波数ドメイン統合によって、再トレーニングなしにノイズの多い2次元関節検出への感受性をどの程度低減できるか?
  • RQ4重度の2次元検出エラー下でも、提案手法は3次元ポーズ推定における時間的一致性を維持できるか?
  • RQ5周波数ドメインアプローチは、PoseFormerを越えて他の変換器ベースの3次元HPEモデルにも一般化可能か?

主な発見

  • PoseFormerV2 は、Human3.6M(プロトコル1)で8.2mmのMPJPEを達成し、PoseFormerV1(13.0mm、1.36 GFLOPs)や他の最先端手法を上回った。
  • 27× 受信フィールド拡張を適用した場合、計算コストは0.12 GFLOPsにまで低下し、PoseFormerV1 より4.6倍高速化され、9.7mmのMPJPEを達成した。
  • ノイズの多いCPN 2次元検出条件下でも、PoseFormerV2 は9.7mmのMPJPEを維持したのに対し、PoseFormerV1 は44.3mmにまで低下した。これは、極めて高いロバスト性を示している。
  • 定性的な結果から、PoseFormerV2 は遮蔽、欠損関節、2次元関節の入れ替えに対しても正しく3次元ポーズを推定でき、時間的一致性の高さが顕著に現れた。
  • 本手法は良好な一般化性能を示した:MHFormer や MixSTE に対しても適用したところ、ロバスト性が向上し、FLOPsが削減された。これにより、相互運用性と転送可能性が確認された。
  • 周波数ドメイン表現は運動のグローバルな視点を提供し、フレーム単位のノイズを圧倒的に抑制し、フレーム間の一貫性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。