Skip to main content
QUICK REVIEW

[論文レビュー] Human Pose Estimation from Depth Images via Inference Embedded Multi-task Learning

Keze Wang, Shengfu Zhai|arXiv (Cornell University)|Aug 13, 2016
Human Pose and Action Recognition参考文献 39被引用数 4
ひとこと要約

本稿では、深度画像からの人体ポーズ推定のための推論埋め込み型マルチタスクディープラーニングフレームワークを提案する。完全畳み込みネットワーク(FCN)を用いてヒートマップを予測し、動的計画法による推論を埋め込んだ新規なMatchNetを併用することで、外見的特徴と3次元キネマティック整合性を同時に最適化する。本手法は、挑戦的な深度データにおいて最先端の精度を達成し、既存のSDKや手法を上回り、類似の推論重視手法と比較して190倍高速である。

ABSTRACT

Human pose estimation (i.e., locating the body parts / joints of a person) is a fundamental problem in human-computer interaction and multimedia applications. Significant progress has been made based on the development of depth sensors, i.e., accessible human pose prediction from still depth images [32]. However, most of the existing approaches to this problem involve several components/models that are independently designed and optimized, leading to suboptimal performances. In this paper, we propose a novel inference-embedded multi-task learning framework for predicting human pose from still depth images, which is implemented with a deep architecture of neural networks. Specifically, we handle two cascaded tasks: i) generating the heat (confidence) maps of body parts via a fully convolutional network (FCN); ii) seeking the optimal configuration of body parts based on the detected body part proposals via an inference built-in MatchNet [10], which measures the appearance and geometric kinematic compatibility of body parts and embodies the dynamic programming inference as an extra network layer. These two tasks are jointly optimized. Our extensive experiments show that the proposed deep model significantly improves the accuracy of human pose estimation over other several state-of-the-art methods or SDKs. We also release a large-scale dataset for comparison, which includes 100K depth images under challenging scenarios.

研究の動機と目的

  • 深度画像における既存の人体ポーズ推定手法の限界、特に非標準のポーズや自己遮蔽の処理における課題を解決する。
  • 従来のアプローチで個別に最適化されたコンponentsによる性能の低さを克服する。
  • 特徴学習と構造的制約を同時に最適化する統合型ディープラーニングフレームワークを構築する。
  • 自己遮蔽や非標準的ボディポーズなどの複雑な状況下でも、ロバスト性と精度を向上させる。
  • 動的計画法をニューラルネットワークアーキテクチャに埋め込むことで、効率的な推論を実現する。

提案手法

  • 深度画像内の全ボディパーツの信頼度スコアを表すヒートマップを生成するために、完全畳み込みネットワーク(FCN)を用いる。
  • 外見一致と3次元キネマティック制約をネットワークレイヤーの一部として統合した、新規の推論内蔵型MatchNetを適用する。
  • 最適なボディパーツ構成を特定するために、動的計画法の推論を微分可能レイヤーとしてMatchNetに埋め込む。
  • マルチタスク学習目的関数を用いて、FCNとMatchNetの両コンponentをエンドツーエンドで同時に最適化する。
  • パーツ候補とテンプレート間の幾何学的・外見的適合性を活用して、最終的なポーズ推定を精緻化する。
  • 人体構造に基づいた妥当な関節関係を強制する3次元キネマティック制約モデルを導入する。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングフレームワークは、深度画像からの人体ポーズ推定において、特徴抽出と構造的推論を同時に最適化できるか?
  • RQ2ニューラルネットワークアーキテクチャに直接推論(動的計画法)を埋め込むことで、ポーズ推定の精度と効率性がどのように向上するか?
  • RQ33次元キネマティック制約を組み込むことで、困難なポーズや遮蔽状況での性能はどの程度向上するか?
  • RQ4本手法は、最先端の手法や商用SDKと比較して、精度と推論速度の両面で優れているか?
  • RQ5最終的なポーズ推定において、外見一致と幾何的制約の寄与度はそれぞれどの程度か?

主な発見

  • 提案手法はK2HGDデータセットにおいて最先端の性能を達成し、最新のMicrosoft Kinect SDKや他のSOTA手法を顕著に上回った。
  • 推論ステップを組み込んでいるにもかかわらず、Chenらの手法に比べ190倍高速で、Tompsonらの手法に比べ5倍高速であった。
  • 推論内蔵型MatchNetは、肘、肩、膝、足といった重要な関節において、FCN単体やFCN+標準的MatchNetベースラインよりも精度が向上した。
  • 3次元キネマティック制約コンponentは性能向上に顕著な貢献を示し、ポーズ推定における構造的事前知識の重要性を裏付けた。
  • 商用SDKがしばしば失敗する自己遮蔽や非標準的ポーズに対しても、本手法はロバストであることが示された。
  • アブレーションスタディにより、最適な性能を達成するには、外見一致と幾何的適合性の両方が不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。