Skip to main content
QUICK REVIEW

[論文レビュー] Cross-View Tracking for Multi-Human 3D Pose Estimation at over 100 FPS

Long Chen, Haizhou Ai|arXiv (Cornell University)|Mar 9, 2020
Human Pose and Action Recognition参考文献 33被引用数 12
ひとこと要約

本論文は、複数のキャリブレーション済みカメラを用いたリアルタイムな複数人物3次元ポーズ推定のためのクロスビュー追跡フレームワークを提案する。時間的一致性を活用して、3次元空間における2次元ポーズを反復的に3次元ポーズにマッチングする。初回から再関連付けを行うのではなく、時間的に3次元ポーズを更新することで、12台のカメラで154 FPS、28台のカメラで34 FPSを達成し、計算効率と遮蔽・ノイズの多い2次元検出に対するロバスト性が著しく向上する。

ABSTRACT

Estimating 3D poses of multiple humans in real-time is a classic but still challenging task in computer vision. Its major difficulty lies in the ambiguity in cross-view association of 2D poses and the huge state space when there are multiple people in multiple views. In this paper, we present a novel solution for multi-human 3D pose estimation from multiple calibrated camera views. It takes 2D poses in different camera coordinates as inputs and aims for the accurate 3D poses in the global coordinate. Unlike previous methods that associate 2D poses among all pairs of views from scratch at every frame, we exploit the temporal consistency in videos to match the 2D inputs with 3D poses directly in 3-space. More specifically, we propose to retain the 3D pose for each person and update them iteratively via the cross-view multi-human tracking. This novel formulation improves both accuracy and efficiency, as we demonstrated on widely-used public datasets. To further verify the scalability of our method, we propose a new large-scale multi-human dataset with 12 to 28 camera views. Without bells and whistles, our solution achieves 154 FPS on 12 cameras and 34 FPS on 28 cameras, indicating its ability to handle large-scale real-world applications. The proposed dataset is released at https://github.com/longcw/crossview_3d_pose_tracking.

研究の動機と目的

  • 複数の人物がいる混雑したマルチカメラ環境における曖昧なクロスビュー2次元ポーズ関連付けの課題に対処すること。
  • カメラ数の増加に伴い関連付けの計算量が急激に増加する大規模マルチカメラシステムにおける計算複雑度の低減。
  • 複数視点における3次元的一致性を活用することで、ノイズの多い2次元キーポイント検出および部分的遮蔽に対するロバスト性の向上。
  • 100 FPSを超えるリアルタイム3次元ポーズ推定を、最大28台のカメラを含む大規模な展開環境でも実現すること。
  • 新しい大規模マルチカメラデータセットを導入することで、実世界の監視および行動分析に適したスケーラブルなソリューションを提供すること。

提案手法

  • 一度にすべてのビューを再処理するのではなく、時間的に3次元ポーズを維持・更新する反復的クロスビュー複数人物追跡フレームワークを提案する。
  • エピポール幾何学と3次元関節的一致性に基づき、各カメラの2次元検出を既存の3次元ポーズに3次元空間における幾何的類似度でマッチングする。
  • 複数のビューからのマッチングされた2次元検出を用いて三角測量により3次元ポーズを精錬する、新しいインクリメンタル3次元再構築アルゴリズムを導入する。
  • 時間的一致性を追跡の安定化に活用するため、類似度関数に時間ペナルティ項($\lambda_a$, $\lambda_t$)を組み込む。
  • 2次元と3次元の類似度の重み付き融合($w_{2D}=0.4$, $w_{3D}=0.6$)を適用し、検出品質と幾何的一致性のバランスを取る。
  • サイクル一貫性制約を含むグラフ分割を用いて曖昧な関連付けを解消し、複数視点間での有効な人物単位のグループ化を保証する。

実験結果

リサーチクエスチョン

  • RQ1複数視点における反復的3次元ポーズ追跡は、バッチ処理によるクロスビュー関連付けと比較して計算複雑度を低減できるか?
  • RQ2動画における時間的一致性は、ノイズの多い2次元キーポイント検出および部分的遮蔽に対するロバスト性をどのように向上させるか?
  • RQ33次元ポーズ追跡フレームワークは、例え28台のカメラのような大規模カメラシステムに対しても、リアルタイム性能を維持できるか?
  • RQ4公開ベンチマークおよび大規模な実世界環境において、提案手法は最先端手法と比較して、精度と速度の両面で優れているか?
  • RQ5異なる類似度重み付けおよびしきい値設定戦略が、追跡の精度と安定性に与える影響は何か?

主な発見

  • 12台のカメラで154 FPS、28台のカメラで34 FPSを達成し、大規模な実世界展開へのスケーラビリティを示した。
  • Campus、Shelf、CMU Panopticデータセットにおいて、それぞれ96.63%、96.58%、96.49%の最先端のPCPスコアを達成し、高い関連付け精度を示した。
  • アブレーションスタディの結果、3次元類似度が性能に不可欠であることが判明。2次元類似度を無効化しても96.38%の関連付け精度を維持した。
  • 12〜28台のカメラ視点を有する提案データセットにより、標準ベンチマークを超えたスケーラビリティと実世界応用可能性の評価が可能になった。
  • 特に遮蔽が激しい混雑したシーンにおいて、ペairワイズエピポール制約とグラフ分割を用いたベースライン手法を上回った。
  • 低フレームレート(例:Storeデータセットで10 FPS)でも高い精度を維持しており、時間的変動に対するロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。