Skip to main content
QUICK REVIEW

[論文レビュー] ArtTrack: Articulated Multi-person Tracking in the Wild

Eldar Insafutdinov, Mykhaylo Andriluka|arXiv (Cornell University)|Dec 5, 2016
Human Pose and Action Recognition参考文献 8被引用数 19
ひとこと要約

ArtTrackは、時空間的推論と効率的なスパム時空間的グループ化を活用することで、非制約的な動画における骨格付き多人数追跡を高速かつボトムアップに実現する手法を提案する。本手法は、スパースなボディパーツグラフとフィードフォワード畳み込みニューラルネットワークを組み合わせ、関節から人物への関連付けを実行する。MPII Video PoseおよびWe Are Familyデータセットにおいて最先端の精度を達成するとともに、従来手法比24倍の高速性を実現した。

ABSTRACT

In this paper we propose an approach for articulated tracking of multiple people in unconstrained videos. Our starting point is a model that resembles existing architectures for single-frame pose estimation but is substantially faster. We achieve this in two ways: (1) by simplifying and sparsifying the body-part relationship graph and leveraging recent methods for faster inference, and (2) by offloading a substantial share of computation onto a feed-forward convolutional architecture that is able to detect and associate body joints of the same person even in clutter. We use this model to generate proposals for body joint locations and formulate articulated tracking as spatio-temporal grouping of such proposals. This allows to jointly solve the association problem for all people in the scene by propagating evidence from strong detections through time and enforcing constraints that each proposal can be assigned to one person only. We report results on a public MPII Human Pose benchmark and on a new MPII Video Pose dataset of image sequences with multiple people. We demonstrate that our model achieves state-of-the-art results while using only a fraction of time and is able to leverage temporal information to improve state-of-the-art for crowded scenes.

研究の動機と目的

  • 遮蔽、高速運動、変化する外観を伴う非制約的な動画における骨格付き多人数追跡を解決する。
  • 人数が不明で混雑したシーンにおいて、エンドツーエンドモデルの限界を克服する。
  • 時間的・空間的要因を統合的に考慮することで、関節間の関連付けを共同で推論し、追跡精度を向上させる。
  • 高い精度を維持しつつ計算コストを低減する効率的な推論フレームワークを開発する。
  • 現実的で混雑したシーンにおける骨格付き追跡の評価を目的とした新規ベンチマークデータセット、MPII Video Poseを構築する。

提案手法

  • 計算量を削減するため、必須の空間的接続のみを含むスパースなボディパーツ関係グラフを用いる。
  • フィードフォワード畳み込みニューラルネットワークを訓練し、関節から人物への関連付けを予測することで、反復的最適化に起因する大部分の推論をオフロードする。
  • トップダウン検出ヘッドを用いて各フレームごとにボディパーツの候補を生成し、スパム時空間的グラフ分割によりそれらを統合する。
  • 1つの候補に1人の人物が対応する制約と人物間の排他制約を課すことで、追跡を連合割り当て問題として定式化する。
  • 検出距離、ディープ特徴マッチング、SIFTベースの類似度といった時系列特徴を組み込み、フレーム間での追跡の一貫性を向上させる。
  • 局所的な組み合わせ最適化を適用することで、効率的な推論を実現し、リアルタイム性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1スパースで高速な推論モデルは、完全接続型モデルを上回る性能を示せるか?
  • RQ2フィードフォワードによる関節から人物への関連付けは、遮蔽や複雑なシーンに対しても効果的か?
  • RQ3時系列モデリングは、混雑した非制約的な動画において、どの程度追跡精度を向上させられるか?
  • RQ4ボトムアップアプローチは、人数が不明で強い遮蔽が発生するシーンにも一般化可能か?
  • RQ5幾何、外観、SIFTといった異なる時系列特徴は、追跡のロバスト性にどの程度寄与するか?

主な発見

  • 提案手法は新規のMPII Video Poseデータセットで73.1%のAPを達成し、時系列特徴を活用した単一フレームベースライン比で1.5%の向上を達成した。
  • TD/BUモデルはWe Are Familyデータセットにおいて、DeeperCutを5.7%のAP向上で上回った。特に手首や肘といった困難な部位で顕著な改善が見られた。
  • 最先端の手法と比較して24倍の高速性を実現しながら、同等またはそれ以上の精度を維持した。
  • ディープマッチやSIFT距離といった時系列特徴は、特に高速運動や背景の変化がある状況で性能を顕著に向上させた。
  • 明示的なトップダウン推論と時系列伝搬により、部分的遮蔽された四肢(例:後方の脚)の再構築に成功した。
  • スパースグラフモデルは完全接続型モデルと同等の性能を示したが、推論コストを著しく削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。