Skip to main content
QUICK REVIEW

[論文レビュー] Seeing Invisible Poses: Estimating 3D Body Pose from Egocentric Video

Hao Jiang, Kristen Grauman|arXiv (Cornell University)|Mar 24, 2016
Human Pose and Action Recognition参考文献 14被引用数 10
ひとこと要約

本論文は、体の大部分が見えないエゴセントリック動画から3次元全身ポーズを推定するための新規手法を提案する。動的運動シグネイチャーや静的シーン構造を利用して1フレームごとのポーズを推定し、非パrametricなポーズダイナミクスと動的計画法を用いてシーケンス全体を最適化することで、最先端の性能を達成し、未学習の被験者において平均関節誤差が最大6 cm改善された。

ABSTRACT

Understanding the camera wearer's activity is central to egocentric vision, yet one key facet of that activity is inherently invisible to the camera--the wearer's body pose. Prior work focuses on estimating the pose of hands and arms when they come into view, but this 1) gives an incomplete view of the full body posture, and 2) prevents any pose estimate at all in many frames, since the hands are only visible in a fraction of daily life activities. We propose to infer the "invisible pose" of a person behind the egocentric camera. Given a single video, our efficient learning-based approach returns the full body 3D joint positions for each frame. Our method exploits cues from the dynamic motion signatures of the surrounding scene--which changes predictably as a function of body pose--as well as static scene structures that reveal the viewpoint (e.g., sitting vs. standing). We further introduce a novel energy minimization scheme to infer the pose sequence. It uses soft predictions of the poses per time instant together with a non-parametric model of human pose dynamics over longer windows. Our method outperforms an array of possible alternatives, including deep learning approaches for direct pose regression from images.

研究の動機と目的

  • エゴセントリック動画において体の大部分が見えない状況での人物の3次元全身ポーズ推定という課題に対処すること。
  • マルチカメラ設定や高コストな計算を必要とせず、単一の胸に取り付けたカメラからのみで「見えない」ポーズを推定する手法を開発すること。
  • フレーム単位の予測と人間の運動ダイナミクスの時間的モデリングを統合することで、ポーズ推定の精度を向上させること。
  • 体の一部が頻繁に隠蔽されるような制約のない現実世界環境でも頑健なポーズ推定を可能とすること。
  • アクティビティ理解や健康モニタリングなどのエゴセントリックビジョン応用に実用的で効率的なソリューションを提供すること。

提案手法

  • 本手法は2段階のアプローチを採用する:まず、フレーム単位の分類器が動的運動シグネイチャーや静的シーン構造の手がかりを用いて、量子化された3次元ポーズの確率を推定する。
  • ポーズ変化(立ち上がりや座り込みなど)に関連する運動パターンを捉えるために、シーンに依存しない動的ホモグラフィー特徴を抽出する。
  • 訓練シーケンスから学習された非パrametricな人間のポーズダイナミクスモデルにより、時間的に妥当なポーズ遷移を表現する。
  • グローバル最適化ステップでは、動的計画法を用いて訓練データの例示シーケンスを通じて最小コストのポーズ経路を特定し、フレーム単位の予測を時間的事前分布で正則化する。
  • 最終的なポーズシーケンスは、フレーム単位の信頼度スコアと時間的整合性を組み合わせたコスト関数を最小化することで計算される。
  • 本手法は効率的であり、1フレームあたり約0.5秒で実行可能で、マルチカメラハードウェアや長時間の処理を必要としない。

実験結果

リサーチクエスチョン

  • RQ1体の大部分が見えないエゴセントリック動画から、3次元全身ポーズを正確に推定できるか?
  • RQ2動的運動シグネイチャーや静的シーン構造が、直接観測できない状況でもポーズ推定に十分な手がかりを提供できるか?
  • RQ3ポーズダイナミクスの時間的モデリングは、シーケンス内のフレーム単位のポーズ予測精度を向上させられるか?
  • RQ4本手法は、学習時に見なかった新しい被験者や環境に一般化して性能を発揮するか?
  • RQ5エゴセントリックデータで直接学習された深層学習回帰手法を上回ることができるか?

主な発見

  • 提案手法は、未学習の被験者および環境において、平均関節誤差が19.9 cm(NAvgAll)および23.6 cm(NAvg(W+A))を達成し、表2のすべてのベースラインを顕著に上回った。
  • 同一被験者・クロス環境テストでは、平均誤差17.2 cm(NAvgAll)を達成し、次に良い手法よりも10 cm以上優れた性能を示した。
  • アンクルおよび膝関節において、常に立っていると仮定するベースラインと比較して平均で6 cmの誤差低減を達成し、細分化されたポーズ推定能力を示した。
  • 地面の真値が得られない厳しい屋外シーケンスでさえ、図10の側面視比較により妥当で一貫性のある3次元ポーズ予測を生成した。
  • 本手法はドメインシフトに対して頑健であり、新しい被験者や環境への一般化性能が高く、ベースライン手法と比較して性能低下が著しく小さい。
  • 失敗事例の主な原因は、入力が曖昧な場合(例:エゴセントリックビューに影響しない腕のポーズ、立ち上がりと座り込みの誤認)であり、特徴の改善の余地があることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。