Skip to main content
QUICK REVIEW

[論文レビュー] VoxelPose: Towards Multi-Camera 3D Human Pose Estimation in Wild Environment

Hanyue Tu, Chunyu Wang|arXiv (Cornell University)|Apr 13, 2020
Human Pose and Action Recognition参考文献 41被引用数 12
ひとこと要約

VoxelPoseは、2Dヒートマップを3Dボクセル特徴量に統合することで、2D対応マッチングに起因する誤差を回避する、3D空間で直接作業する新規な3D多人像ポーズ推定フレームワークを提案する。Cuboid Proposal Network (CPN) を用いて粗い3D人物位置を推定し、Pose Regression Network (PRN) を用いて詳細な3Dポーズ推定を実行する。CampusおよびShelfデータセットにおいて、遮蔽に強い性能を発揮し、最先端の性能を達成した。

ABSTRACT

We present an approach to estimate 3D poses of multiple people from multiple camera views. In contrast to the previous efforts which require to establish cross-view correspondence based on noisy and incomplete 2D pose estimations, we present an end-to-end solution which directly operates in the $3$D space, therefore avoids making incorrect decisions in the 2D space. To achieve this goal, the features in all camera views are warped and aggregated in a common 3D space, and fed into Cuboid Proposal Network (CPN) to coarsely localize all people. Then we propose Pose Regression Network (PRN) to estimate a detailed 3D pose for each proposal. The approach is robust to occlusion which occurs frequently in practice. Without bells and whistles, it outperforms the state-of-the-arts on the public datasets. Code will be released at https://github.com/microsoft/multiperson-pose-estimation-pytorch.

研究の動機と目的

  • 野生環境下における不正確で不完全な2Dポーズ推定の課題に対処すること、特に遮蔽下での性能を向上させること。
  • 2Dから3Dへの対応マッチングを複雑化する必要を排除するため、3D空間で直接作業すること。
  • 複数カメラ間で統一された3D特徴表現を用いることで、多人像3Dポーズ推定の頑健性と精度を向上させること。
  • 正確な2Dキーポoinトアノテーションに依存するのを減らし、多様なカメラ設定に一般化できるようにすること。

提案手法

  • まず、CNNベースの2Dポーズ推定器を用いて、すべてのカメラビューの2Dヒートマップ表現を推定する。
  • 次に、これらの2Dヒートマップを共通の3Dボクセル空間に投影・変形することで、包括的な3D特徴量体積を構築し、完全性を高め、ノイズを低減する。
  • 3D特徴量体積にCuboid Proposal Network (CPN) を適用し、シーン内の全人物の粗い3Dボクシッドプロポーザルを生成する。
  • 各プロポーザルに対して、より細かい3D特徴量体積を抽出し、Pose Regression Network (PRN) に供給して詳細な3D関節座標を回帰する。
  • CPNとPRNは3D畳み込み層を用いて共同で学習され、明示的な2Dキーポイント連携を必要としないエンドツーエンド学習が可能になる。
  • 3D空間的一致性を通じて、視野内および視野間の関節対応を暗黙的に処理することで、後処理のクラスタリングに依存するのを低減する。

実験結果

リサーチクエスチョン

  • RQ12D対応マッチングを回避することで、遮蔽に強い3D人体ポーズ推定が可能になるか?
  • RQ2複数視点の2Dヒートマップから構築した3Dボクセル特徴量体積は、推定精度と完全性を向上させられるか?
  • RQ33D畳み込みネットワークを用いた直接的な3D予測は、実世界の設定において2段階の2D→3Dパイプラインを上回る性能を発揮できるか?
  • RQ4合成ヒートマップで学習したモデルは、微調整なしに実世界データに一般化できるか?

主な発見

  • VoxelPoseはCampusデータセットで96.7%のPCP3D精度を達成し、先行の最先端手法(96.3%)を上回った。
  • Shelfデータセットでは97.0%のPCP3Dを達成し、以前の最良手法(96.9%)を上回り、誤検出を顕著に低減した。
  • 本手法は優れた一般化性能を示し、Human3.6Mの単一人物ベンチマークでも19 mmのMPJPEを達成した。
  • 合成ヒートマップへの一般化が良好であり、合成データで学習したモデルは、実画像で学習したモデルとほぼ同等の性能を発揮した。
  • 2Dキーポイントアノテーションの不正確さに起因する誤差を、2D検出品質に依存するのではなく3D空間的一致性に依存することで低減した。
  • 1台のTian X GPU上で推論に約300msを要し、スパース3D畳み込みを用いることでさらなる高速化が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。