Skip to main content
QUICK REVIEW

[論文レビュー] Real-time Human Pose Estimation from Video with Convolutional Neural Networks

Marko Linna, Kannala, Juho|arXiv (Cornell University)|Sep 23, 2016
Human Pose and Action Recognition参考文献 29被引用数 7
ひとこと要約

本論文では、多様な公開データセットを用いた事前学習と、Kinectを用いて収集した用途固有のデータに対するファインチューニングを経る2段階のディープラーニングアプローチを用いた、リアルタイムで多人数のポーズ推定を実現するシステムを提示する。この手法は、96.8%の精度(PCK@0.2)を達成し、1回の順伝播で16msの処理時間を実現しており、ポーズや背景の変動が限られた環境におけるジェスチャー制御、ゲーム、アクティビティ認識の分野で、Kinectの代替として高速かつ高精度な選択肢を提供する。

ABSTRACT

In this paper, we present a method for real-time multi-person human pose estimation from video by utilizing convolutional neural networks. Our method is aimed for use case specific applications, where good accuracy is essential and variation of the background and poses is limited. This enables us to use a generic network architecture, which is both accurate and fast. We divide the problem into two phases: (1) pre-training and (2) finetuning. In pre-training, the network is learned with highly diverse input data from publicly available datasets, while in finetuning we train with application specific data, which we record with Kinect. Our method differs from most of the state-of-the-art methods in that we consider the whole system, including person detector, pose estimator and an automatic way to record application specific training material for finetuning. Our method is considerably faster than many of the state-of-the-art methods. Our method can be thought of as a replacement for Kinect, and it can be used for higher level tasks, such as gesture control, games, person tracking, action recognition and action tracking. We achieved accuracy of 96.8\% (PCK@0.2) with application specific data.

研究の動機と目的

  • ポーズや背景の変動が限られた環境と、特定用途に特化した制約のある条件下で、高速かつ高精度な人体ポーズ推定システムを開発すること。
  • ジェスチャー制御やアクティビティ認識などの上位レベルのタスクをサポートするリアルタイム動作を実現するディープラーニングベースのシステムにより、Kinectを置き換えること。
  • Kinectを用いて自動的に大規模なデータ収集を可能とし、トレーニングデータのアノテーションを効率的に実施すること。
  • 入力画像内の人物を検出・クロップする別個の人物検出器を統合することで、人物の位置を事前に知らずに多人数のポーズ推定を可能とすること。
  • サンプル間で関節セットが異なる不均一なトレーニングデータに対しても対応できるようにし、異なるキーポイントアノテーションを持つ多様なデータセットを統合してトレーニングに活用できるようにすること。

提案手法

  • 本手法は、まず多様な公開データセットを用いて事前学習段階で汎用的な8層ConvNetアーキテクチャをトレーニングする。
  • その後、Kinectを用いて収集した用途固有のデータを用いてネットワークをファインチューニングする。このデータは、実世界の動画シーケンスにおける正確な3次元関節アノテーションを提供する。
  • 別個の人物検出器が入力画像内の人物を局所化・クロップすることで、人物の位置を事前に把握しない状態でも多人数のポーズ推定が可能になる。
  • 本システムは、Kinectの深度情報とRGBデータを活用し、正確な2次元および3次元関節アノテーションを備えた大規模で弱教師ありのトレーニングデータを自動生成する。
  • ネットワークは、サンプル間で関節セットが変動する状況にも対応できるようにトレーニングされ、キーポイントアノテーションが異なるデータセットを統合して利用できる。
  • 人物検出器を含まない場合の順伝播推論時間は16ms、含む場合の時間は76~216msであり、実用的な状況でリアルタイム性能を維持できる。

実験結果

リサーチクエスチョン

  • RQ12段階のCNNベースのアプローチ(事前学習→ファインチューニング)は、制約のある用途固有のポーズ推定において、高い精度とリアルタイム性能を達成できるか?
  • RQ2汎用的な事前学習に比べ、用途固有のデータに対するファインチューニングがポーズ推定の精度をどの程度向上させるか?
  • RQ3実世界のシナリオにおいて、Kinectを用いて大規模かつ正確なトレーニングデータを自動的に生成することが有効に機能するか?
  • RQ4人物検出器の統合は、非制約的な動画入力における多人数ポーズ推定の実用性とスケーラビリティにどのような影響を与えるか?
  • RQ5ポーズ推定性能において、多様なデータに対する汎用性とドメイン固有のデータに対する特化性の間には、どのようなトレードオフが存在するか?

主な発見

  • 完全なファインチューニング後、用途固有のデータに対して96.8%の精度(PCK@0.2)を達成し、実用的な有用性が明確に示された。
  • 手首の推定精度は、事前学習時(24.5%)から完全なファインチューニング時(89.2%)に大幅に向上し、重要な関節に対してドメイン特化データの恩恵が顕著に現れた。
  • ファインチューニング後、事前学習用の検証セットでの精度は63.1%から44.2%に低下し、汎用性と特化性の間のトレードオフが確認された。
  • 1回の順伝播が16msという高速な処理時間を維持しており、ジェスチャー制御やゲームなどのインタラクティブなアプリケーションに適している。
  • Kinectを用いた自動データ収集により、手動アノテーションを伴わず、大規模で正確なトレーニングデータセットの生成が可能になった。
  • 制約のある環境下では、汎用的なポーズ推定モデルに比べて本手法が優れた性能を示し、特定用途に特化したファインチューニングが一般モデルを上回ることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。