Skip to main content
QUICK REVIEW

[論文レビュー] Occlusion-aware Hand Pose Estimation Using Hierarchical Mixture Density Network

Qi Ye, Tae‐Kyun Kim|arXiv (Cornell University)|Nov 29, 2017
Human Pose and Action Recognition参考文献 30被引用数 10
ひとこと要約

本稿では、自己遮蔽を扱うために3次元手関節姿勢推定を条件付き確率分布としてモデル化する、エンドツーエンドで学習可能な新規フレームワークである階層的混合密度ネットワーク(HMDN)を提案する。2段階の階層構造——可視関節には単一のガウス分布、遮蔽された関節には混合ガウス分布を用いる——により、多モードの姿勢分布を捉え、多様で解釈可能な候補サンプルを生成する。このアプローチは、遮蔽が顕著なベンチマークにおいて、最先端手法を著しく上回る性能を発揮する。

ABSTRACT

Learning and predicting the pose parameters of a 3D hand model given an image, such as locations of hand joints, is challenging due to large viewpoint changes and articulations, and severe self-occlusions exhibited particularly in egocentric views. Both feature learning and prediction modeling have been investigated to tackle the problem. Though effective, most existing discriminative methods yield a single deterministic estimation of target poses. Due to their single-value mapping intrinsic, they fail to adequately handle self-occlusion problems, where occluded joints present multiple modes. In this paper, we tackle the self-occlusion issue and provide a complete description of observed poses given an input depth image by a novel method called hierarchical mixture density networks (HMDN). The proposed method leverages the state-of-the-art hand pose estimators based on Convolutional Neural Networks to facilitate feature learning, while it models the multiple modes in a two-level hierarchy to reconcile single-valued and multi-valued mapping in its output. The whole framework with a mixture of two differentiable density functions is naturally end-to-end trainable. In the experiments, HMDN produces interpretable and diverse candidate samples, and significantly outperforms the state-of-the-art methods on two benchmarks with occlusions, and performs comparably on another benchmark free of occlusions.

研究の動機と目的

  • 遮蔽下での多モードの姿勢分布をモデル化できない、従来の判別的手関節姿勢推定手法が単一の決定的出力しか得られないという限界を解消すること。
  • 平均二乗誤差による学習で複数の真値姿勢を平均化することによって生じる、遮蔽された関節に対する物理的に不自然な予測を是正すること。
  • 特に頻繁に自己遮蔽が発生するエゴセントリック視点において、入力の深度画像に条件づけた完全な確率的描写を提供すること。
  • 微分可能な密度関数を用いて、特徴量の共同学習と複雑な多モードの姿勢分布のモデル化を同時に実現する、エンドツーエンドで学習可能な深層ネットワークの構築を可能にすること。
  • 1回の順伝播で多様で運動学的に妥当な姿勢仮説を生成できることにより、トラッキングやマルチステージ推定などの下流タスクを支援すること。

提案手法

  • 関節位置の分布を2段階でモデル化する階層的混合密度ネットワーク(HMDN)を導入する。まず、潜在的な可視性変数が関節が可視か遮蔽済みかを決定する。
  • 可視関節に対しては、HMDNは関節位置の条件付き分布を単一ガウス分布(SGN)でモデル化する。
  • 遮蔽された関節に対しては、HMDNは同じ入力画像に対して複数の妥当な姿勢配置を捉えるために混合ガウスモデル(GMM)を採用する。
  • HMDNフレームワークは、CNNベースの特徴抽出器の上に積み重ねられ、微分可能な密度関数を用いたエンドツーエンド学習を可能にする。
  • ネットワークは、予測された混合分布下での真値姿勢の尤度を最適化する負の対数尤度損失を用いて学習される。
  • 推論時、HMDNは遮蔽された関節のGMMからサンプリングし、可視関節のSGNからサンプリングすることで、不確実性下でも頑健な姿勢推定が可能な多様な候補姿勢を生成する。

実験結果

リサーチクエスチョン

  • RQ1深層学習フレームワークは、微分可能でエンドツーエンドで学習可能な形で、遮蔽された手関節の多モードの姿勢分布をモデル化できるか?
  • RQ2可視性を潜在変数としてモデル化することで、自己遮蔽下での3次元手関節姿勢推定の精度と多様性は向上するか?
  • RQ3階層的混合密度アプローチは、単一分布ベースライン(例:SGN)や既存の多仮説手法に比べ、精度とサンプルの多様性の両面で優れているか?
  • RQ4HMDNは、遮蔽度合いが異なるベンチマークで、特に最先端の決定的および生成的手法と比較して、どのように性能を発揮するか?
  • RQ5HMDNの確率的出力は、多様で妥当な姿勢仮説を提供するため、ハンドトラッキングやハイブリッド姿勢推定などの下流タスクを改善できるか?

主な発見

  • MSHDデータセット(顕著な遮蔽を含む)において、HMDNは最先端手法を著しく上回った。特に遮蔽された関節において顕著な優位性を示した。
  • MSHDベンチマークでは、8個のガウス成分を用いたHMDNが、遮蔽された関節で平均誤差11.8 mmを達成し、Tangら[12](14.2 mm)とYeら[31](15.1 mm)を上回った(100個のサンプルを用いて)。
  • HMDNは、HMDN hardおよびHMDN softの変種よりも一貫して低い誤差を達成し、特にHMDN softが、成分数の異なる状況において最良の性能を示した。
  • NYUデータセット(遮蔽が少ない)では、HMDNはSGNと同等の性能を示し、可視関節では2位、遮蔽された関節では3位を記録した。これは、低遮蔽状況でも頑健であることを示している。
  • HMDNが生成するサンプルは、多様かつ正確であり、Tangら[12]が意思決定ツリーにGMMを用いたように、高い分散を示す手法とは異なり、分布が集中している。
  • 可視化比較により、HMDNのサンプルはYeら[31]やTangら[12]のものよりも真値に近いことが確認された。特に遮蔽された関節において顕著で、真の多モード分布を適切にモデル化できていることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。