Skip to main content
QUICK REVIEW

[論文レビュー] Combining detection and tracking for human pose estimation in videos

Manchen Wang, Joseph Tighe|arXiv (Cornell University)|Mar 30, 2020
Human Pose and Action Recognition参考文献 34被引用数 5
ひとこと要約

本稿では、短い動画クリップにおける関節検出とトラッキングを同時に実行する3次元高分解能ネットワーク(HRNet)と、検出された人物のバウンディングボックスの時間的伝搬を組み合わせることで、マルチパーソンの動画内でのポーズ推定とトラッキングのための新規なトップダウン的手法を提案する。複数のポーズ仮説における空間的・時間的整合性を活用することで、誤検出を是正し、PoseTrack 2017および2018で最先端の性能を達成し、従来手法と比較してキーポイント検出誤差を28%低減、トラッキング誤差を9%低減した。

ABSTRACT

We propose a novel top-down approach that tackles the problem of multi-person human pose estimation and tracking in videos. In contrast to existing top-down approaches, our method is not limited by the performance of its person detector and can predict the poses of person instances not localized. It achieves this capability by propagating known person locations forward and backward in time and searching for poses in those regions. Our approach consists of three components: (i) a Clip Tracking Network that performs body joint detection and tracking simultaneously on small video clips; (ii) a Video Tracking Pipeline that merges the fixed-length tracklets produced by the Clip Tracking Network to arbitrary length tracks; and (iii) a Spatial-Temporal Merging procedure that refines the joint locations based on spatial and temporal smoothing terms. Thanks to the precision of our Clip Tracking Network and our merging procedure, our approach produces very accurate joint predictions and can fix common mistakes on hard scenarios like heavily entangled people. Our approach achieves state-of-the-art results on both joint detection and tracking, on both the PoseTrack 2017 and 2018 datasets, and against all top-down and bottom-down approaches.

研究の動機と目的

  • 遮蔽や重なりによる人物検出器の失敗が生じる動画におけるトップダウン型ポーズ推定の限界を是正すること。
  • 時間的整合性と複数フレームにわたる推論を活用することで、人物検出器が人物を検出できなくてもポーズ推定の精度を向上させること。
  • 時間的伝搬と共同仮説の精緻化を用いて、検出器の故障からの回復を実現する手法を開発すること。
  • トップダウンおよびボトムアップ両アプローチを凌駕する、ポーズ検出およびトラッキングベンチマークにおける最先端の性能を達成すること。

提案手法

  • 短い動画クリップ内で関節を同時に検出し、それらをトラッキングするための3次元HRNetに基づくクリップトラッキングネットワーク。初期段階で3次元畳み込みを導入。
  • 時間的関連付けと空間的一致性を用いて、重複する短いトラックレットを統合し、長期的な人物トラックを生成する動画トラッキングパイプライン。
  • 複数のポーズ仮説において空間的近接性と時間的滑らかさを強制することで、最適な関節位置を選択する空間的・時間的統合手順。
  • 検出に失敗したフレームでさえも、既知の人物バウンディングボックスを時間的に前向き・後向きに伝搬させ、空間的・時間的チューブを構築することで関節予測を実現。
  • 3次元HRNetアーキテクチャは、関節間の時間的対応関係を学習するように設計されており、除去実験により初期段階での3次元畳み込みが最良の性能を示した。
  • 推論速度と精度のバランスを取るために、可変ステップサイズを有するキーフレーム戦略を採用。フレームサンプリングを低減することで線形の高速化を達成。

実験結果

リサーチクエスチョン

  • RQ1遮蔽や運動ブラーのため検出器が失敗する動画において、人物検出の時間的伝搬がポーズ推定の性能向上に寄与するか。
  • RQ2短い動画クリップ上で関節検出とトラッキングを同時に最適化することで、困難なポーズや遮蔽に対する耐性を高められるか。
  • RQ3コンSENSUSに基づく空間的・時間的統合手順が、個々のポーズ仮説からの誤予測を効果的に是正できるか。
  • RQ4特に重なりや複雑な状況下で、トップダウンアプローチがボトムアップ手法を上回る程度はどの程度か。
  • RQ5本手法は人物検出器の品質にどれほど敏感か。時間的推論により、弱い検出器に対しても補完的効果を発揮できるか。

主な発見

  • 提案手法はPoseTrack 2017および2018の両ベンチマークで最先端の性能を達成し、従来のトップダウン手法と比較してキーポイント検出誤差を28%低減した。
  • PoseTrack 2018ではトラッキング誤差を9%低減し、既存のすべてのトップダウンおよびボトムアップ手法を上回った。
  • 初期段階に3次元畳み込みを導入した3次元HRNet(「Early」設計)が最良の性能を示し、後段階に3次元フィルタを導入するモデルや完全に3次元化されたアーキテクチャを上回った。
  • 時間的伝搬により、弱いMobileNet-V2検出器を用いても、最大7%の人物検出漏れを回復できた。
  • ステップサイズ8の場合、人物検出器を8フレームに1回しか実行せず、12.5倍の高速化を達成しながらも、mAP(78.9)とMOTA(67.2)を競争力のある水準に維持した。
  • 空間的・時間的統合手順により、重なった人物同士で膝を誤って入れ替えるような誤予測を効果的に是正し、複雑なシーンでも高い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。