Skip to main content
QUICK REVIEW

[論文レビュー] LightTrack: A Generic Framework for Online Top-Down Human Pose Tracking

Guanghan Ning, Heng Huang|arXiv (Cornell University)|May 7, 2019
Human Pose and Action Recognition参考文献 29被引用数 11
ひとこと要約

LightTrackは、骨格に基づくポーズマッチングにシアンズグラフ畳み込みネットワーク(SGCN)を用いて、単一人物のポーズ追跡と多人数のアイデンティティ連携を統合する汎用的でリアルタイムなオンライン上位から下位のフレームワークを提案する。このフレームワークは、オンライン手法の中での最先端の性能を達成しながらも、高いフレームレートを維持しており、既存のオンライン手法を上回り、47.11 fps(ポーズ推論を除く)の速度でオフラインSOTAと競合する。

ABSTRACT

In this paper, we propose a novel effective light-weight framework, called LightTrack, for online human pose tracking. The proposed framework is designed to be generic for top-down pose tracking and is faster than existing online and offline methods. Single-person Pose Tracking (SPT) and Visual Object Tracking (VOT) are incorporated into one unified functioning entity, easily implemented by a replaceable single-person pose estimation module. Our framework unifies single-person pose tracking with multi-person identity association and sheds first light upon bridging keypoint tracking with object tracking. We also propose a Siamese Graph Convolution Network (SGCN) for human pose matching as a Re-ID module in our pose tracking system. In contrary to other Re-ID modules, we use a graphical representation of human joints for matching. The skeleton-based representation effectively captures human pose similarity and is computationally inexpensive. It is robust to sudden camera shift that introduces human drifting. To the best of our knowledge, this is the first paper to propose an online human pose tracking framework in a top-down fashion. The proposed framework is general enough to fit other pose estimators and candidate matching mechanisms. Our method outperforms other online methods while maintaining a much higher frame rate, and is very competitive with our offline state-of-the-art. We make the code publicly available at: https://github.com/Guanghan/lighttrack.

研究の動機と目的

  • 真正のオンラインで、効率的かつ正確なトップダウン人体ポーズ追跡フレームワークの不足に対処する。
  • 汎用的でモジュラーなシステム内で、単一人物ポーズ追跡と多人数アイデンティティ連携を統合する。
  • 骨格構造を活用することで、ロバストなポーズマッチングを実現する計算効率の良いRe-IDモジュールを開発する。
  • 将来のフレーム情報に依存しないリアルタイム性能を実現する。これは、大多数のオフライン手法とは対照的である。
  • 将来的な拡張性を考慮し、交換可能なポーズ推定器とマッチングメカニズムをサポートする柔軟なフレームワークを構築する。

提案手法

  • 最初のフレームで人間の候補を検出するトップダウン、オンラインポーズ追跡フレームワークを導入し、交換可能な単一人物ポーズ推定器を用いて追跡する。
  • 明示的な人間のキーポイント特徴を用いてバウンディングボックスの一貫性を維持し、データ連携の負荷を低減する。
  • ポーズ類似度を計算してRe-IDに使用するため、人間の関節をグラフとしてモデル化するシアンズグラフ畳み込みネットワーク(SGCN)を提案する。
  • 視覚的特徴抽出と比較して、カメラのドリフトに強く、計算コストも低い骨格ベースの表現を採用する。
  • キーフレームでのみSGCNを用いてデータ連携を実施し、リアルタイム追跡における処理オーバーヘッドを最小限に抑える。
  • モジュラー構造を設計し、パフォーマンスや速度最適化のためにポーズ推定器やマッチングモジュールの交換が可能である。

実験結果

リサーチクエスチョン

  • RQ1真正のオンラインで、高精度かつ高フレームレートを維持する汎用的でトップダウンの人体ポーズ追跡フレームワークを設計できるか?
  • RQ2骨格ベースのグラフィカル表現は、アイデンティティの混同を低減し、カメラドリフトに対処するためにどれほど効果的か?
  • RQ3リアルタイム制約下で、シアンズグラフ畳み込みネットワーク(SGCN)は従来の視覚的Re-IDモジュールを上回れるか?
  • RQ4フレームワークのモularityは、コンponentの交換によってどれほどパフォーマンス向上を可能にするか?
  • RQ5提案されたオンライン手法は、最先端のオフライン手法と比較して、精度と速度の両面でどの程度優れているか?

主な発見

  • LightTrackはPoseTrackデータセットにおいて、既存のすべてのオンラインポーズ追跡手法を上回り、CPN101を用いると72.4 / 66.3 mAP/MOTA、MSRA152を用いると73.3 / 66.4を達成した。
  • フレームレートは47.11 fps(ポーズ推論を除く)を達成しており、他のオンライン手法と比べて顕著に高速である。
  • SGCN Re-IDモジュールは、構造的ポーズの一貫性を活用することで、視覚的類似性やカメラドリフトに起因する誤検出を低減した。
  • 骨格ベースの表現は計算効率が高く、平均して1ペアあたり2.9 msでポーズマッチングが完了した。
  • 軽量なコンponentsを用いても高い精度を維持でき、YOLOv3とMobileNetv1-deconvを用いると2 fpsで70.4 mAPおよび55.7% MOTAを達成した。
  • アブレーションスタディの結果、検出性能の向上がMOTAの向上に直接寄与することが確認され、より良いコンponentを組み込むことでスケーラビリティが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。