Skip to main content
QUICK REVIEW

[論文レビュー] Global Context for Convolutional Pose Machines

Daniil Osokin|arXiv (Cornell University)|Jun 10, 2019
Robotic Mechanisms and Dynamics参考文献 29被引用数 6
ひとこと要約

本論文は、畳み込み姿勢マシン(CPM)の実効的受容 field を向上させるために、U字型のグローバルコンテキストモジュールを提案する。この手法により、グローバルなシーンコンテキストを統合することで、1人乗りのポーズ推定の精度が向上する。LIPデータセットにおいて87.9% PCKhの精度を達成し、160以上のFPSで推論が可能となり、時計型アーキテクチャに比べて高速でありながら、競争力のある精度を維持する。

ABSTRACT

Convolutional Pose Machine is a popular neural network architecture for articulated pose estimation. In this work we explore its empirical receptive field and realize, that it can be enhanced with integration of a global context. To do so U-shaped context module is proposed and compared with the pyramid pooling and atrous spatial pyramid pooling modules, which are often used in semantic segmentation domain. The proposed neural network achieves state-of-the-art accuracy with 87.9% PCKh for single-person pose estimation on the Look Into Person dataset. A smaller version of this network runs more than 160 frames per second while being just 2.9% less accurate. Generalization of the proposed approach is tested on the MPII benchmark and shown, that it faster than hourglass-based networks, while provides similar accuracy. The code is available at https://github.com/opencv/openvino_training_extensions/tree/develop/pytorch_toolkit/human_pose_estimation .

研究の動機と目的

  • CPMベースのポーズ推定ネットワークの実効的受容 field を、グローバルコンテキストの統合によって向上させること。
  • グローバルコンテキストモデリングを通じて、左/右キーポイントの区別が困難な状況やマルチプレイヤーのシーンにおける曖昧さを解消すること。
  • 体部のマスキングを用いた新しいデータ拡張技術により、遮蔽に対する耐性を向上させること。
  • CPMベースのネットワークと時計型アーキテクチャの推論効率を比較すること、特にGPUおよびCPU上での性能を評価すること。
  • 組み込みおよびエッジデプロイメントに適したリアルタイム性能を示すこと。

提案手法

  • マルチスケールのプーリングとスカイプ接続を用いてグローバルコンテキストを統合するU字型コンテキストモジュールを提案し、CPMにおける特徴表現を強化する。
  • CPMアーキテクチャにU字型モジュールを統合し、グローバルなシーン認識を活用してキーポイントのヒートマップを精緻化する。
  • トレーニング中にランダムに体部をマスキングする拡張戦略を採用し、遮蔽を模擬することで耐性を向上させる。
  • 一般化性能を向上させるために、スケール [0.75, 1.0, 1.25] と水平反転を用いたマルチスケールテストを実施する。
  • NVIDIAプロファイラを用いて推論性能をプロファイルし、特に時計型ネットワークにおける1x1畳み込み層のボトルネックを特定する。
  • OpenVINO Toolkitを用いてIntel CPU上にモデルをデプロイし、リアルタイム推論能力を検証する。

実験結果

リサーチクエスチョン

  • RQ1グローバルコンテキストモジュールを用いることで、CPMベースのポーズ推定ネットワークの実効的受容 field を効果的に拡大できるか?
  • RQ2提案されたU字型コンテキストモジュールは、ピラミッドプーリングやアトロス・スパティアルピラミッドプーリングと比較して、ポーズ推定の精度と効率性において優れているか?
  • RQ3体部の遮蔽を模擬するデータ拡張により、一般化性能および現実世界の遮蔽に対する耐性が向上するか?
  • RQ4理論的FLOPsがより高いにもかかわらず、なぜ時計型アーキテクチャのネットワークは提案されたCPMベースのネットワークよりも遅いのか?
  • RQ5提案されたCPMベースのネットワークは、CPUおよびGPU上で高い精度を維持したままリアルタイム推論を達成できるか?

主な発見

  • 提案されたU字型コンテキストモジュールは、LIPデータセットで87.9% PCKhの精度を達成し、以前の最先端手法を上回る。
  • 2段階バージョンのネットワークは、GPU上で160以上のFPSで動作し、フルモデルと比較して精度が2.9%しか低下しない。
  • OpenVINOを用いたIntel Core i7-6850K CPU上では19.5 FPSを達成し、エッジデプロイメントの可能性を示した。
  • 元のCPMよりも25%高速であり、時計型アーキテクチャを上回る速度を達成しながら、MPIIデータセットでも同等またはそれ以上の精度を示した。
  • 時計型アーキテクチャのボトルネックは1x1畳み込み層に起因しており、GPU上でメモリバウンドで非効率であることが特定された。
  • 提案された拡張技術は、特に困難な股関節キーポイントの局在化において性能を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。