Skip to main content
QUICK REVIEW

[論文レビュー] Training a Feedback Loop for Hand Pose Estimation

Markus Oberweger, Paul Wohlhart|arXiv (Cornell University)|Sep 30, 2016
Human Pose and Action Recognition参考文献 28被引用数 15
ひとこと要約

本稿では、深層ニューラルネットワークを用いたデータ駆動型フィードバックループを、深度ベースの3Dハンドポーズ推定に提案する。従来の3Dモデルフィッティングに代わり、学習された画像合成とポーズ更新ネットワークを用いる。この手法は、初期のCNNによる予測ポーズを繰り返し精錬することで、合成深度画像と入力画像の差を最小化する。1つのGPUで400 fpsを超える推論速度を達成し、明示的なモデルフィッティングを不要とすることで、最先端の精度を実現する。

ABSTRACT

We propose an entirely data-driven approach to estimating the 3D pose of a hand given a depth image. We show that we can correct the mistakes made by a Convolutional Neural Network trained to predict an estimate of the 3D pose by using a feedback loop. The components of this feedback loop are also Deep Networks, optimized using training data. They remove the need for fitting a 3D model to the input data, which requires both a carefully designed fitting function and algorithm. We show that our approach outperforms state-of-the-art methods, and is efficient as our implementation runs at over 400 fps on a single GPU.

研究の動機と目的

  • 深度ベースのハンドポーズ推定において、明示的な3Dハンドモデルフィッティングの必要性を排除すること。
  • フィードバックループによる深層ネットワークの反復的補正学習により、ポーズ精度を向上させること。
  • リアルタイム性能(400 fps以上)を達成しつつ、既存手法を上回ること。
  • エンドツーエンドでのポーズ精錬学習が、従来の最適化ベースの手法を上回ることを示すこと。

提案手法

  • 最初の畳み込みニューラルネットワーク(CNN)が、深度画像から初期3Dハンドポーズを予測する。
  • 2番目のCNNが、微分可能レンダリングプロセスを用いて、予測されたポーズから深度画像を合成する。
  • 3番目のディープネットワーク(アップデータ)が、入力深度画像と合成画像の比較を通じて、ポーズ補正を予測する。
  • ポーズは、予測された更新を適用することで繰り返し精錬され、複数回の反復が繰り返される。
  • 初期ポーズ予測器、画像合成器、アップデータのすべてのコンponentsが、実際の深度画像と真値ポーズ上でエンドツーエンドに訓練される。
  • フィードバックループにより、訓練データにないポーズ空間の領域をモデルが探索可能となり、初期値の誤差に対してより頑健になる。

実験結果

リサーチクエスチョン

  • RQ1明示的な3Dモデルフィッティングに依存せずに、学習されたフィードバックループが3Dハンドポーズ推定を改善できるか?
  • RQ2深層ネットワークによる反復的精錬が、従来の最適化ベースの手法を精度と速度の両面で上回れるか?
  • RQ3フィードバックシステムのエンドツーエンド学習により、困難なポーズ、遮蔽、ノイズに対してより良い一般化性能が得られるか?
  • RQ4リアルタイム性能(例:400 fps以上)を維持しつつ、高い精度を達成できるか?

主な発見

  • 本手法は1つのGPUで400 fpsを超える推論速度を達成し、通常12–60 fpsで動作するモデルベース手法を著しく上回る。
  • フィードバックループは、初期推定値を悪化させる傾向がある画像ベースの最適化よりも、ポーズ誤差の低減に効果的である。
  • 初期値が悪くても、すべての初期化においてポーズ精度が向上し、特に親指のような困難な関節で顕著な向上が見られる。
  • ノイズ、遮蔽、欠損深度値に対しても頑健であることが、NYUデータセットを用いて実証された。
  • 初期予測値が真値から大きく離れていても、アップデータネットワークがポーズ誤差を正しく補正できており、ベクトル更新が真値の関節位置に収束することが示された。
  • 多様なハンドポーズに優れた一般化性能を示し、ハンド固有のアーキテクチャ設計や手動による初期化を必要としない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。