Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Graph Reasoning for Multi-person 3D Pose Estimation

Zhongwei Qiu, Qiansheng Yang|arXiv (Cornell University)|Jul 22, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、複数人用3次元ポーズ推定のための新しいボトムアップアプローチであるGR-M3Dを提案する。この手法は、複数のルートキーポイントと密なパスから動的グラフ推論(DGR)を用いて、自己適応的にデコーディンググラフを構築することで、遮蔽や深度のあいまいさに対する耐性を高める。スケールと深度に敏感な精錬(SDAR)モジュールを統合することで、3つのベンチマークで最先端の性能を達成し、トップダウンおよび先行するボトムアップ手法を上回る3.2%の相対的改善を、ベースライン手法に対して3DPCKで達成した。

ABSTRACT

Multi-person 3D pose estimation is a challenging task because of occlusion and depth ambiguity, especially in the cases of crowd scenes. To solve these problems, most existing methods explore modeling body context cues by enhancing feature representation with graph neural networks or adding structural constraints. However, these methods are not robust for their single-root formulation that decoding 3D poses from a root node with a pre-defined graph. In this paper, we propose GR-M3D, which models the extbf{M}ulti-person extbf{3D} pose estimation with dynamic extbf{G}raph extbf{R}easoning. The decoding graph in GR-M3D is predicted instead of pre-defined. In particular, It firstly generates several data maps and enhances them with a scale and depth aware refinement module (SDAR). Then multiple root keypoints and dense decoding paths for each person are estimated from these data maps. Based on them, dynamic decoding graphs are built by assigning path weights to the decoding paths, while the path weights are inferred from those enhanced data maps. And this process is named dynamic graph reasoning (DGR). Finally, the 3D poses are decoded according to dynamic decoding graphs for each detected person. GR-M3D can adjust the structure of the decoding graph implicitly by adopting soft path weights according to input data, which makes the decoding graphs be adaptive to different input persons to the best extent and more capable of handling occlusion and depth ambiguity than previous methods. We empirically show that the proposed bottom-up approach even outperforms top-down methods and achieves state-of-the-art results on three 3D pose datasets.

研究の動機と目的

  • 3次元多人数ポーズ推定における固定ルートデコーディンググラフの限界、特に遮蔽や深度のあいまいさの下での問題を解決すること。
  • 身体部位が頻繁に遮蔽され、スケール変動が大きい混雑したシーンにおける耐障害性の向上。
  • 単一のルートノードに依存するのではなく、複数の可能性のあるキーポイントパスを推論する、動的でデータに適応するデコーディング機構の開発。
  • 人間検出やインスタンス関連付けを必要とせず、トップダウンの検出ステージに依存しない最先端の3次元ポーズ推定性能の達成。

提案手法

  • スケールと深度に敏感な精錬(SDAR)モジュールを導入し、キーポイントのヒートマップ、スケールマップ、深度マップ、3次元オフセットマップの特徴表現を向上させる。
  • 強化された特徴マップから複数のルートキーポイントと密なデコーディングパスを予測し、マルチルートベースの推論を可能にする。
  • 予測されたデコーディングパスに学習されたソフトウェイトを割り当てることで、個々の人物ごとに自己適応的なグラフ構造を持つ動的デコーディンググラフを構築する。
  • 動的グラフ推論(DGR)機構により、強化された特徴マップからパスウェイトを推論し、3次元ポーズデコーディング中に文脈に敏感で自己適応的なメッセージ伝達を実現する。
  • トップダウンのパラダイムを避けるボトムアップのフレームワークを採用し、Hourglass、ResNet、HRNetを含むさまざまなバックボーンと互換性を持つ。
  • 全パイプラインはエンドツーエンドで学習可能であり、ResNet-101 や HRNet-32 といった重いバックボーンを使用してもリアルタイムの推論を達成する。

実験結果

リサーチクエスチョン

  • RQ1遮蔽や深度のあいまいさに対処する際、固定構造のグラフ(例:スターやツリー構造)に比べて、データに適応する動的デコーディンググラフが優れているか?
  • RQ2学習されたパスウェイトを用いたマルチルートベースの推論は、単一ルートデコーディング戦略に比べて性能をどのように向上させるか?
  • RQ3スケールと深度を同時にモデル化する精錬モジュールが、キーポイント予測の質とその後続のデコーディングにどの程度向上効果をもたらすか?
  • RQ4提案された動的グラフ推論機構は、現実世界の制約のない、混雑したシーンに一般化可能か?
  • RQ5動的グラフ推論を備えたボトムアップアプローチは、トップダウン手法と同等またはそれ以上の最先端の性能を達成できるか?

主な発見

  • GR-M3Dは、Hourglassバックボーンを用いてMuPoTS-3Dデータセットで84.6の3DPCKを達成し、先行する最先端手法を上回った。
  • Human3.6Mデータセットでは、同じバックボーンを用いてMPJPEで5%の相対的改善、PA MPJPEで16%の改善を達成した。
  • 群衆インデックスが0.7を超える混雑したシーンでは、ベースラインより5.9%の相対的改善を示し、遮蔽に対する強い耐障害性を示した。
  • MuCo-3DHPデータセットでは、$PCK_{rel}$、$PCK_{abs}$、$AUC_{rel}$ それぞれで、先行するSOTA手法より2.5%、6.5%、3.3%の相対的改善を達成した。
  • GR-M3Dは、ResNet-101 や HRNet-32 といった重いバックボーンを使用しても、15–23 fpsのリアルタイム推論速度を維持しており、ベースライン比でパラメータがわずかに2MB増加した。
  • モデルは制約のない現実世界の画像にも良好に一般化し、3DアノテーションなしのCOCOデータセットに対しても、妥当な3次元ポーズ予測を生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。