Skip to main content
QUICK REVIEW

[論文レビュー] SMAP: Single-Shot Multi-Person Absolute 3D Pose Estimation

Jianan Zhen, Qi Fang|arXiv (Cornell University)|Aug 26, 2020
Human Pose and Action Recognition参考文献 44被引用数 5
ひとこと要約

SMAPは、1枚のRGB画像から複数人の絶対的3次元ポーズを推定する、ワンショットでボトムアップなフレームワークを提案する。新規のルートデプスマップとデプスに配慮したパーツ関連付けを活用し、人物間のデプス関係をモデル化することで、3次元および2次元ポーズ推定の精度を向上させる。CMU PanopticおよびMuPoTS-3Dで最先端の性能を達成し、オクルージョンやスケールのあいまいさに対してより高いロバスト性を示す、実世界の動画にも一般化可能である。

ABSTRACT

Recovering multi-person 3D poses with absolute scales from a single RGB image is a challenging problem due to the inherent depth and scale ambiguity from a single view. Addressing this ambiguity requires to aggregate various cues over the entire image, such as body sizes, scene layouts, and inter-person relationships. However, most previous methods adopt a top-down scheme that first performs 2D pose detection and then regresses the 3D pose and scale for each detected person individually, ignoring global contextual cues. In this paper, we propose a novel system that first regresses a set of 2.5D representations of body parts and then reconstructs the 3D absolute poses based on these 2.5D representations with a depth-aware part association algorithm. Such a single-shot bottom-up scheme allows the system to better learn and reason about the inter-person depth relationship, improving both 3D and 2D pose estimation. The experiments demonstrate that the proposed approach achieves the state-of-the-art performance on the CMU Panoptic and MuPoTS-3D datasets and is applicable to in-the-wild videos.

研究の動機と目的

  • 1枚のRGB画像から複数人の絶対的3次元ポーズを推定する課題に取り組む。深度とスケールのあいまいさが正確な再構成を妨げるためである。
  • トップダウン手法がグローバルなコンテキストを無視するという限界を克服するため、ボトムアップなアプローチを提案する。このアプローチでは、ボディサイズ、シーンレイアウト、人物間関係といった画像全体の手がかりを集約する。
  • 特にオクルージョンや重なっている状況において、人物間のデプス関係を明示的にモデル化することで、3次元ポーズ推定を向上させる。
  • 2次元キーポイントのヒートマップ、パーツアフィニティフィールド、相対的デプスマップ、ルートデプスマップを同時に回帰する統合的ワンフォワードパスフレームワークを構築し、3次元ポーズの一貫性を向上させる。

提案手法

  • 完全畳み込みネットワークを用いてルートデプスマップを回帰し、3次元ポーズアノテーションを監視として用いて、入力画像から各人物のルートジョイントの深度を直接予測する。
  • 2次元キーポイントのヒートマップとパーツアフィニティフィールド(PAFs)を同時に予測し、ボトムアップなアプローチで複数人の間でボディパーツを局所化および関連付ける。
  • 各パーツの2つのジョイント間の相対的デプスを符号化する新しいパーツ相対的デプスマップを導入し、パーツ関連付け時にデプスに配慮した推論を可能にする。
  • デプスに配慮したパーツ関連付けアルゴリズムは、予測された深度を用いてオクルージョンを解消し、現実的なボーン長制約を強制することで、キーポイントグループ化の精度を向上させる。
  • 最終的な3次元ポーズは、2次元キーポイントの関連付け結果と予測されたルートデプスマップ、相対的デプスマップを組み合わせることで再構築され、一貫性のある絶対的3次元位置が保証される。
  • パイプライン全体をエンドツーエンドで学習可能であり、モデルが画像全体にわたるデプス関連手がかりをグローバルに学習できる。

実験結果

リサーチクエスチョン

  • RQ1グローバルな画像コンテキストとデプス手がかりを活用することで、ワンショットでボトムアップなフレームワークが複数人の絶対的3次元ポーズを効果的に推定できるか?
  • RQ2画像から直接ボディのデプスを予測することで、後続のデプス再回帰と比較して、3次元ポーズ推定とパーツ関連付けにどのように寄与するか?
  • RQ3デプスに配慮したパーツ関連付けは、重なっているまたはオクルージョンしている人体における誤差をどの程度低減するか?
  • RQ4提案手法は実世界の動画に一般化可能であり、CMU Panoptic や MuPoTS-3D のようなベンチマークデータセットで最先端の性能を達成できるか?
  • RQ5ルートデプスと相対的デプスの監視は、全体の3次元ポーズ推定精度にどの程度寄与しているか?

主な発見

  • SMAPはCMU Panopticデータセットで最先端の性能を達成し、PCK@0.2絶対精度が89.2%、Human3.6Mでの平均MPJPEが54.1 mmを記録した。
  • MuPoTS-3Dデータセットでは、PCK relスコアが80.5%、PCK absスコアが38.7%を達成し、シーケンス単位およびマッチドグランドトゥルース評価の両方で先行手法を上回った。
  • アブレーションスタディの結果、ルートデプス監視を追加することで、PCK rootは2Dのみのケース(29.9%)から45.5%に向上した。これはデプス監視の価値を示している。
  • デプスに配慮したパーツ関連付けアルゴリズムは、深度予測を活用することで、オクルージョン状況におけるキーポイント関連付け誤差を低減した。
  • ルートデプス、相対的デプス、2次元ブランチを備えたフルモデルは、MuPoTS-3Dデータセットで92.3%のリCALLを達成し、ルートデプスのみのバージョン(85.0%リCALL)を著しく上回った。
  • SMAPは、複数人やオクルージョンが複雑に絡む非制約的で複雑なシーンにおいても、実世界の動画にうまく一般化できることを、定性的な結果で示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。