Skip to main content
QUICK REVIEW

[論文レビュー] Pose-Oriented Transformer with Uncertainty-Guided Refinement for 2D-to-3D Human Pose Estimation

Han Li, Bowen Shi|arXiv (Cornell University)|Feb 15, 2023
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、2次元から3次元人体ポーズ推定のための2段階型トランスフォーマーフレームワーク、Pose-Oriented Transformer (POT) と Uncertainty-Guided Refinement Network (UGRN) を提案する。POT は自己注意機構を人体骨格トポロジーを捉えるポーズ指向のメカニズムと距離関連の位置埋め込みで強化し、UGRN は不確実性を考慮したサンプリングと注意機構を用いて予測を精緻化し、Human3.6M および MPI-INF-3DHP でパラメータ数を減らしながら最先端の性能を達成する。

ABSTRACT

There has been a recent surge of interest in introducing transformers to 3D human pose estimation (HPE) due to their powerful capabilities in modeling long-term dependencies. However, existing transformer-based methods treat body joints as equally important inputs and ignore the prior knowledge of human skeleton topology in the self-attention mechanism. To tackle this issue, in this paper, we propose a Pose-Oriented Transformer (POT) with uncertainty guided refinement for 3D HPE. Specifically, we first develop novel pose-oriented self-attention mechanism and distance-related position embedding for POT to explicitly exploit the human skeleton topology. The pose-oriented self-attention mechanism explicitly models the topological interactions between body joints, whereas the distance-related position embedding encodes the distance of joints to the root joint to distinguish groups of joints with different difficulties in regression. Furthermore, we present an Uncertainty-Guided Refinement Network (UGRN) to refine pose predictions from POT, especially for the difficult joints, by considering the estimated uncertainty of each joint with uncertainty-guided sampling strategy and self-attention mechanism. Extensive experiments demonstrate that our method significantly outperforms the state-of-the-art methods with reduced model parameters on 3D HPE benchmarks such as Human3.6M and MPI-INF-3DHP

研究の動機と目的

  • 自己注意機構において人体骨格トポロジーを無視する既存のトランスフォーマー基盤の 3D 人体ポーズ推定手法の限界を是正すること。
  • 親骨盤から離れた関節の推定誤差を低減すること。これは、奥行きの曖昧性により本質的に推定が困難であるため。
  • 精緻化段階で予測不確実性を明示的にモデル化することで、3D ポーズ推定のロバスト性と正確性を向上させること。
  • モデル複雑性を低減しつつ、最先端の性能を達成する軽量で効果的なフレームワークを設計すること。

提案手法

  • 関節間のトポロジー的関係を相対的距離に基づく注意バイアスで符号化する Pose-Oriented Self-Attention (PO-SA) 機構を提案。
  • 親骨盤からの距離で関節をグループ化する距離関連位置埋め込みを導入し、回帰が困難な関節をよりよく表現する。
  • 推定された関節ごとの不確実性を用いて、予測周辺の候補3次元座標のサンプリングをガイドする Uncertainty-Guided Refinement Network (UGRN) を開発。
  • UGRN で不確実性に配慮した自己注意機構(UG-SA)を採用し、高不確実性の関節の影響を低減。
  • UGRN でガウス分布によるサンプリング戦略を採用し、予測座標を推定された不確実性を分散として摂動させることでロバスト性を向上。
  • 2段階パイプラインを組み合わせる:まず、POT がトポロジーに配慮した注意機構を用いて3次元ポーズを予測。次に、UGRN が不確実性に配慮したメカニズムを用いて予測を精緻化。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構に人体骨格トポロジーを明示的にモデル化することで、3次元人体ポーズ推定性能にどのような影響を与えるか?
  • RQ2親骨盤からの距離で関節をグループ化することで、とくに遠く離れた関節の推定精度が向上するか?
  • RQ3精緻化プロセスに予測不確実性を組み込むことで、困難な関節の推定性能が向上するか?
  • RQ4不確実性を考慮したサンプリングと注意機構は、標準的手法と比較して3次元ポーズ精緻化のロバスト性をどのように向上させるか?
  • RQ5軽量な2段階型トランスフォーマーフレームワークは、既存手法よりも少ないパラメータ数で最先端の性能を達成できるか?

主な発見

  • 提案手法は、Human3.6M データセットで平均関節位置誤差(MPJPE)33.82mm を達成し、以前の最先端手法を上回った。
  • 距離関連の位置埋め込みを導入することで、キーポoin位置埋め込みのみのベースラインと比較し、MPJPEが0.88mm 減少した。
  • 標準的な自己注意機構を Pose-Oriented Self-Attention (PO-SA) に置き換えることで、パラメータ数が0.01M増加するのみでMPJPEが1.10mm 減少した。
  • 不確実性を考慮した精緻化段階(UGRN)により、1段階目のPOT予測のみと比較してMPJPEが0.83mm 改善した。
  • UGRN で不確実性を考慮したサンプリングとUG-SAを採用することで、さらに0.9mm の性能向上が得られ、不確実性に配慮した学習の有効性が示された。
  • パラメータ数を大幅に削減しながらも最先端の性能を達成した。Our-L バージョンは埋め込み次元96、トランスフォーマーレイヤー12/3を採用し、過剰パラメータ化を回避しながら最適な性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。