Skip to main content
QUICK REVIEW

[論文レビュー] Learning Dynamics via Graph Neural Networks for Human Pose Estimation and Tracking

Yiding Yang, Zhou Ren|arXiv (Cornell University)|Jun 7, 2021
Video Surveillance and Tracking Methods被引用数 5
ひとこと要約

本論文では、視覚的検出に依存せずに、過去のポーズトラッケットから人間のポーズダイナミクスを学習するグラフニューラルネットワーク(GNN)ベースの手法を提案する。これにより、遮蔽やごみだらけのシーンでもロバストな推定が可能になる。予測されたダイナミクスと検出されたポーズを統合することで、PoseTrack 2017および2018で最先端の性能を達成し、誤検出やトラッキングの切り替えを顕著に低減した。

ABSTRACT

Multi-person pose estimation and tracking serve as crucial steps for video understanding. Most state-of-the-art approaches rely on first estimating poses in each frame and only then implementing data association and refinement. Despite the promising results achieved, such a strategy is inevitably prone to missed detections especially in heavily-cluttered scenes, since this tracking-by-detection paradigm is, by nature, largely dependent on visual evidences that are absent in the case of occlusion. In this paper, we propose a novel online approach to learning the pose dynamics, which are independent of pose detections in current fame, and hence may serve as a robust estimation even in challenging scenarios including occlusion. Specifically, we derive this prediction of dynamics through a graph neural network~(GNN) that explicitly accounts for both spatial-temporal and visual information. It takes as input the historical pose tracklets and directly predicts the corresponding poses in the following frame for each tracklet. The predicted poses will then be aggregated with the detected poses, if any, at the same frame so as to produce the final pose, potentially recovering the occluded joints missed by the estimator. Experiments on PoseTrack 2017 and PoseTrack 2018 datasets demonstrate that the proposed method achieves results superior to the state of the art on both human pose estimation and tracking tasks.

研究の動機と目的

  • 視覚的ヒントが欠落する遮蔽やごみだらけのシーンにおいて、検出器ベースのポーズトラッキングの限界を克服すること。
  • ブレーキや遮蔽による視覚検出器の故障によって引き起こされる誤検出やトラッキングの切り替えを低減すること。
  • 学習可能なGNNベースの予測器を用いて、人間のポーズの時間的ダイナミクスをモデル化することで、ポーズトラッキングのロバスト性を向上させること。
  • 統合的かつエンド・トゥ・エンド微分可能なフレームワーク内で、学習されたダイナミクスと視覚的検出を統合し、ポーズ推定を強化すること。

提案手法

  • グラフニューラルネットワーク(GNN)を、過去のポーズトラッケットから将来のポーズを予測するように訓練し、ボディ関節間の空間的・時間的関係をモデル化する。
  • GNNは過去のポーズの系列をグラフとして処理し、ノードは関節を表し、エッジは空間的および時間的依存関係を符号化する。
  • 現在のフレームの視覚的検出に依存せずにポーズ予測が生成されるため、遮蔽やブレの状況でもロバスト性が保証される。
  • 予測されたポーズは、現在のフレームの検出されたポーズと、学習可能なマージング機構を介して統合され、最終的な高精度な推定値が得られる。
  • GNNはアテンションメカニズムを用い、関節間の関係を動的に重み付けする。学習されたアテンション重みは、重要な関節間の相互作用を可視化する。
  • システム全体がエンド・トゥ・エンドで訓練され、関節特徴とダイナミクスパラメータが同時に最適化される。

実験結果

リサーチクエスチョン

  • RQ1GNNベースのモデルは、現在のフレームの視覚的検出に依存せずに、過去のトラッケットから信頼性の高いポーズダイナミクスを学習し、将来のポーズを予測できるか?
  • RQ2学習されたポーズダイナミクスを組み込むことで、遮蔽やブレといった困難な状況での性能はどのように向上するか?
  • RQ3メモリ長さとモデル容量が、ポーズ予測の正確性とロバスト性に与える影響は何か?
  • RQ4視覚的検出と予測されたダイナミクスを統合する手法は、従来の検出器ベースのトラッキングと比較して、トラッキング精度と安定性の面でどのように優れているか?

主な発見

  • 提案手法は、PoseTrack 2017の検証セットでmAP 81.1、MOTA 73.4を達成し、最先端の手法を上回った。
  • PoseTrack 2018では、mAP 69.2、MOTA 69.2を達成し、ポーズ推定とトラッキングの両面で優れた性能を示した。
  • アブレーションスタディの結果、GNNによる予測ポーズをマッチング指標として用いることで、切り替えレートが1.3%に低下し、IOUおよびOKSベースラインと比較してMOTAが1.3ポイント向上した。
  • モデル性能は4フレームのメモリ長さで飽和し、それ以上の窓サイズでは利得が減少することが示された。
  • アテンション重みの可視化から、仙骨や膝といった重要な関節が予測に強く影響していることが明らかになった。これは、現実的な人間の運動ダイナミクスを反映している。
  • モデルサイズの拡大はmAPおよびMOTAの両方を向上させ、複雑なダイナミクスを学習するにあたり、高い容量の利点が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。