Skip to main content
QUICK REVIEW

[論文レビュー] Learning 3D Human Dynamics from Video

Angjoo Kanazawa, Jason Zhang|arXiv (Cornell University)|Dec 4, 2018
Human Pose and Action Recognition参考文献 64被引用数 10
ひとこと要約

本稿では、画像特徴の時系列符号化を用いて動画から3次元人体ダイナミクスを学習する半教師ありフレームワーク、Human Mesh and Motion Recovery (HMMR) を提案する。インターネット規模のラベルなし動画と疑似真値2次元ポーズを用いて訓練することで、野生環境のデータセットにおける3次元ポーズ予測で最先端性能を達成し、データ量の増加に伴い3次元および2次元の精度が単調に向上する。また、動画からの滑らかな3次元メッシュ予測と、単一画像からの動的モーションハリュウケーションも可能となる。

ABSTRACT

From an image of a person in action, we can easily guess the 3D motion of the person in the immediate past and future. This is because we have a mental model of 3D human dynamics that we have acquired from observing visual sequences of humans in motion. We present a framework that can similarly learn a representation of 3D dynamics of humans from video via a simple but effective temporal encoding of image features. At test time, from video, the learned temporal representation give rise to smooth 3D mesh predictions. From a single image, our model can recover the current 3D mesh as well as its 3D past and future motion. Our approach is designed so it can learn from videos with 2D pose annotations in a semi-supervised manner. Though annotated data is always limited, there are millions of videos uploaded daily on the Internet. In this work, we harvest this Internet-scale source of unlabeled data by training our model on unlabeled video with pseudo-ground truth 2D pose obtained from an off-the-shelf 2D pose detector. Our experiments show that adding more videos with pseudo-ground truth 2D pose monotonically improves 3D prediction performance. We evaluate our model, Human Mesh and Motion Recovery (HMMR), on the recent challenging dataset of 3D Poses in the Wild and obtain state-of-the-art performance on the 3D prediction task without any fine-tuning. The project website with video, code, and data can be found at https://akanazawa.github.io/human_dynamics/.

研究の動機と目的

  • 制御された環境を超えて一般化可能な3次元人体ダイナミクスモデルを動画から学習すること。
  • 時系列的文脈を活用することで、動画シーケンスからの滑らかな3次元メッシュ予測を可能にすること。
  • 1枚の画像入力から、現在の3次元ポーズに加え、過去および未来のモーションをハリュウケーションモジュールを用いて予測すること。
  • 疑似2次元ポーズアノテーションを用いた大規模なラベルなし動画に対する半教師あり学習により、3次元人体ポーズ推定性能を向上させること。
  • インターネット規模の動画から得た疑似真値2次元ポーズを用いた学習が、3次元予測性能を向上させることを示すこと。

提案手法

  • 時系列符号化器 f_movie は、画像特徴 φ_t の系列を処理し、中心時刻の周囲の時系列ウィンドウ内で3次元ダイナミクス表現 Φ_t を学習する。
  • 2次元再投影損失と敵対的損失を併用したマルチタスクヘッドにより、現在の3次元ポーズおよび形状 Θ_t、および ±Δt フレームでのポーズ変化を予測する。
  • ハリュウケーションモジュール h は、1枚の画像特徴 φ_t を時系列表現 Φ_t にマッピングし、推論時における静的画像からの動的予測を可能にする。
  • 3次元損失を真値が利用可能な場合に適用し、2次元再投影損失と敵対的事前分布を用いて、現実的な3次元ポーズを保証する。
  • 事前学習済み2次元検出器(OpenPose)を用いて得た疑似2次元ポーズを伴う、インターネット規模のデータセット(例:InstaVariety, VLOG)のラベルなし動画を用いる。
  • 本フレームワークはオムニスーパvised(包括的教師信号)をサポートし、限られた3次元/2次元アノテーションと大規模なラベルなし動画を組み合わせることで、一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ12次元ポーズの監視とラベルなしデータにおける自己教師学習のみを用いて、動画から3次元人体ダイナミクスを学習できるか?
  • RQ2インターネット規模のラベルなし動画と疑似2次元ポーズを用いた学習が、3次元ポーズ予測性能を向上させるか?
  • RQ31枚の画像入力から、現在の3次元ポーズに加え、妥当な過去および未来のモーションを予測できるか?
  • RQ4時系列符号化器は、単一視点ベースラインと比較して、3次元予測の滑らかさと加速度誤差の低減にどのように寄与するか?
  • RQ5ハリュウケーションモジュールは、野生環境や制約のない環境にどれほど一般化可能か?

主な発見

  • HMMRは、最大規模の疑似ラベル付きデータセット(InstaVariety)で学習した場合、3DPWデータセットでMPJPE 116.5の最先端性能を達成し、先行手法を上回る。
  • InstaVarietyで学習した場合、より小さなデータセットで学習した場合と比較して、3次元ポーズ誤差が9%低下し、2次元ポーズ精度が8%向上する。
  • 動画シーケンスからの予測において、単一視点ベースラインと比較して加速度誤差を56%低減する。
  • ハリュウケーションモジュールにより、1枚の画像からの妥当な3次元モーション予測が可能となり、Human3.6Mにおける過去予測のPA-MPJPEは65.0、未来予測は65.3を達成する。
  • NBA や Penn などの2次元ポーズデータセットにおける性能は安定的またはわずかに向上し、疑似ラベル付きデータからの一般化効果が示される。
  • 本モデルは野生環境においても良好に一般化し、3DPWにおいて、Fine-tuning を行わない TP-Net よりも優れた性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。