Skip to main content
QUICK REVIEW

[論文レビュー] VoxelTrack: Multi-Person 3D Human Pose Estimation and Tracking in the Wild

Yifu Zhang, Chunyu Wang|arXiv (Cornell University)|Aug 5, 2021
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

VoxelTrack は、マルチビュー画像から3次元ボクセル表現を用いて、2次元ポーズ推定と関連付けのノイズを回避し、ボリューム空間内で直接3次元ポーズと Re-ID 特徴を回帰することで、エンドツーエンドの3次元多人数ポーズ推定およびトラッキングフレームワークを提案する。Shelf、Campus、CMU Panoptic データセットにおいて最先端の性能を達成し、遮蔽に強い Re-ID 特徴融合を用いて 98.67 の IDF1 とゼロの ID スイッチを達成した。

ABSTRACT

We present VoxelTrack for multi-person 3D pose estimation and tracking from a few cameras which are separated by wide baselines. It employs a multi-branch network to jointly estimate 3D poses and re-identification (Re-ID) features for all people in the environment. In contrast to previous efforts which require to establish cross-view correspondence based on noisy 2D pose estimates, it directly estimates and tracks 3D poses from a 3D voxel-based representation constructed from multi-view images. We first discretize the 3D space by regular voxels and compute a feature vector for each voxel by averaging the body joint heatmaps that are inversely projected from all views. We estimate 3D poses from the voxel representation by predicting whether each voxel contains a particular body joint. Similarly, a Re-ID feature is computed for each voxel which is used to track the estimated 3D poses over time. The main advantage of the approach is that it avoids making any hard decisions based on individual images. The approach can robustly estimate and track 3D poses even when people are severely occluded in some cameras. It outperforms the state-of-the-art methods by a large margin on three public datasets including Shelf, Campus and CMU Panoptic.

研究の動機と目的

  • ノイズの多い2次元検出による誤差伝搬に苦しむ、段階的な2次元ポーズ推定と3次元再構築パイプラインの限界を解消する。
  • 著しい遮蔽や外観変化下における、クロスビュー2次元ポーズ関連付けと3次元ポーズトラッキングの課題を克服する。
  • 個々の視点の品質に依存を最小限に抑えるために、共有された3次元ボクセル空間でマルチビュー情報を統合し、頑健な3次元ポーズ推定とトラッキングを実現する。
  • 外観特徴が損なわれた場合でもトラッキングの頑健性を向上させるために、遮蔽に強い Re-ID 特徴融合戦略を導入する。
  • 実世界への展開に適した、5台のカメラで15 FPS で動作する軽量でエンドツーエンドのシステムを設計する。

提案手法

  • 3次元空間を離散化して3次元ボクセルグリッドを構築し、全カメラビューからのボディジョイントのヒートマップを逆投影によって集約する。
  • 3次元スパース畳み込みネットワークを用いて、各ボクセルが特定のボディジョイントを含むかどうかを予測し、ボクセル表現から直接3次元ポーズ推定を可能にする。
  • 同時に各ボクセルの Re-ID 特徴を予測し、遮蔽マスクを用いて信頼性の低い特徴を遮蔽度の高いビューから抑制するように、複数ビュー間で特徴を統合する。
  • 深度情報を活用して遮蔽された視点の特徴を特定・破棄するように、マルチビュー Re-ID 特徴融合戦略を採用する。
  • 3次元キーポイント類似度と遮蔽に強い Re-ID 特徴を組み合わせた3次元ポーズトラッキングを、単純な二部マッチングトラッカーで実行する。
  • 3次元ポーズ推定ヘッドを合成データで学習させ、大規模な3次元現実世界アノテーションを必要としない実用的展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1中間の2次元ポーズ推定と関連付けステップを回避することで、3次元多人数ポーズ推定とトラッキングが顕著に向上するか?
  • RQ2遮蔽下でも頑健性を向上させるために、マルチビュー情報の統合に3次元ボクセル表現がどの程度有効か?
  • RQ3遮蔽に強い Re-ID 特徴融合は、困難な現実世界シナリオにおけるトラッキング精度をどの程度向上させるか?
  • RQ4合成データで効果的に事前学習し、実データで微調整することで、3次元ポーズ推定ネットワークを実用的展開に適した形で利用できるか?
  • RQ5リアルタイム推論能力を備えたエンドツーエンドの3次元ボクセルベーストラッキングシステムの計算効率はどの程度か?

主な発見

  • VoxelTrack は CMU Panoptic データセットで 98.67 の IDF1 スコアとゼロの ID スイッチを達成し、先行手法を顕著に上回った。
  • アブレーションスタディにより、遮蔽に強い Re-ID 特徴融合が極めて重要であることが確認され、生の Re-ID 特徴を使用した場合と比較して ID スイッチを 90 から 0 に削減した。
  • 3次元ポーズ距離のみを用いると IDF1 は 93.82、ID スイッチは 90 にとどまり、遮蔽下ではポーズのみのトラッキングに限界があることが示された。
  • MobileNet-V2 とスパース3次元畳み込みを用いて、5台のカメラ入力でも 15 FPS で動作し、強力なリアルタイム実用性を示した。
  • 3次元ポーズ推定ヘッドは合成データで学習可能であり、実世界ベンチマークに良好に一般化するため、アノテーション依存性が低減された。
  • トラッキングモジュールは遅延をわずか 2ms に抑えることができ、全体のシステムが効率的でリアルタイムアプリケーションに適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。