Skip to main content
QUICK REVIEW

[論文レビュー] Temporally Coherent Full 3D Mesh Human Pose Recovery from Monocular Video

Jian Liu, Naveed Akhtar|arXiv (Cornell University)|Jun 1, 2019
Human Pose and Action Recognition参考文献 48被引用数 6
ひとこと要約

本論文は、単眼動画から時間的に整合性のある完全な3Dメッシュ人体ポーズを回復するための新規エンドツーエンドの再帰的ニューラルネットワーク、MVIPERを提案する。物理ベースのデータ合成パイプラインを導入することで、動的で変形する衣装を含む、リアルで多様な単眼行動動画と豊富な3Dメッシュアノテーションを生成し、フレームベースのベースラインと比較して顕著に優れた時間的整合性と幾何的正確性を達成した。これにより、ジターリダクションが顕著に改善され、遮蔽や複雑なポーズ状況下での回復性能も向上した。

ABSTRACT

Advances in Deep Learning have recently made it possible to recover full 3D meshes of human poses from individual images. However, extension of this notion to videos for recovering temporally coherent poses still remains unexplored. A major challenge in this regard is the lack of appropriately annotated video data for learning the desired deep models. Existing human pose datasets only provide 2D or 3D skeleton joint annotations, whereas the datasets are also recorded in constrained environments. We first contribute a technique to synthesize monocular action videos with rich 3D annotations that are suitable for learning computational models for full mesh 3D human pose recovery. Compared to the existing methods which simply "texture-map" clothes onto the 3D human pose models, our approach incorporates Physics based realistic cloth deformations with the human body movements. The generated videos cover a large variety of human actions, poses, and visual appearances, whereas the annotations record accurate human pose dynamics and human body surface information. Our second major contribution is an end-to-end trainable Recurrent Neural Network for full pose mesh recovery from monocular video. Using the proposed video data and LSTM based recurrent structure, our network explicitly learns to model the temporal coherence in videos and imposes geometric consistency over the recovered meshes. We establish the effectiveness of the proposed model with quantitative and qualitative analysis using the proposed and benchmark datasets.

研究の動機と目的

  • 完全にアノテートされた大規模で現実的かつリアルな単眼動画データセットが、完全な3Dメッシュ人体ポーズ回復の分野において不足しているという問題に対処すること。
  • 時間的文脈を活用して、1視点動画から時間的に整合性のある3D人体メッシュを回復できる深層学習モデルの開発。
  • フレームごとの3Dポーズ推定手法と比較して、メッシュシーケンスの幾何的整合性を向上させ、時間的ジターリダクションを実現すること。
  • リアルな衣装の動的変形を伴う、動画ベースのモーショントランスファーなどの新応用を可能にすること。
  • 関節ベースの指標を超えて、メッシュレベルのポーズ回復に特化した新たな評価指標の導入。

提案手法

  • 物理ベースのアニメーションパイプラインにより、リアルな衣装・身体の相互作用、多様なポーズ、照明、視点、背景を備えた単眼動画を生成。
  • データセットには、ボディシェイプ、3Dスケルトン、2D投影、および全メッシュ頂点シーケンスを含む高密度な3Dアノテーションが含まれる。
  • 時間的・空間的ダイナミクスをモデル化するため、順序付きでフレームを処理する、注意機構を備えたエンドツーエンド学習可能なRNNアーキテクチャを採用。
  • ネットワークは再帰的構造を採用し、文脈的条件付けブロックにより、複数フレームにわたる低レベルの視覚的特徴に注目する。
  • 訓練中に、連続するメッシュフレーム間の幾何的整合性を強制するためのボディシェイプ滑らかさ損失を導入。
  • 汎用性を高めるために、本研究で提案する合成データセットに加え、Human3.6M や UCF101 といったベンチマークデータセットでもモデルを訓練。

実験結果

リサーチクエスチョン

  • RQ1合成動画データにおける衣装の物理ベースのシミュレーションが、3Dメッシュポーズ回復モデルのリアリズムと一般化性能を向上させるか?
  • RQ2注意機構を備えた再帰的ニューラルネットワークが、単眼動画シーケンスにおいて時間的整合性と幾何的整合性をどれほど効果的に学習できるか?
  • RQ3提案手法が、遮蔽や複雑な運動を含む状況において、フレームベースの3Dメッシュ回復手法を上回る性能を発揮できるか?
  • RQ4ポーズ補間を含む多様な合成動画データで学習することで、稀なまたは未観測のポーズに対するロバストネスがどの程度向上するか?
  • RQ5メッシュレベルの評価指標は、従来の関節ベースの指標と比較して、完全なメッシュ回復性能の評価においてどの程度正確な評価が可能か?

主な発見

  • フレームベースの手法(例:HMR)と比較して、回復されたメッシュシーケンスにおける時間的ジターリダクションが顕著に改善され、幾何的整合性が向上した。
  • Human3.6M や UCF101 における定性的な比較において、HMRが時間的文脈を欠いているために失敗する遮蔽肢(例:体の後ろにある左腕)の再構築にも成功した。
  • UCF101 の「ワイルド」な動画に対しても、ポーズ補間を含む多様な訓練データのおかげで、ハンドスタンドなどのレアポーズを正確に回復できた。
  • 訓練データにおける物理ベースの衣装シミュレーションにより、リアリズムが向上し、動的衣装変形の処理性能も向上した。
  • 頂点ごとの誤差指標の導入により、関節ベースの指標よりもメッシュレベルの回復忠実度をより正確に評価できるようになった。
  • モーショントランスファーの実験により、実世界の人体の動きを、新規の衣装と背景を備えた仮想アバターに高精細に転送でき、本手法の実用的有用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。