Skip to main content
QUICK REVIEW

[論文レビュー] 3D Human Motion Estimation via Motion Compression and Refinement

Zhengyi Luo, S. Alireza Golestaneh|arXiv (Cornell University)|Aug 9, 2020
Human Pose and Action Recognition参考文献 51被引用数 10
ひとこと要約

本稿では、最初に変分オートエンコーダー(VAE)を用いて動画シーケンスを滑らかで一般的な運動表現に圧縮し、その後に人物固有の回帰器で微細な運動詳細を精緻化する二段階の3次元人体運動推定手法MEVAを提案する。3DPWにおいて加速度誤差を54.3%低減しつつ、最先端のMPJPEを達成し、正確で時間的に滑らかな3次元ポーズシーケンスの推定を実現する。

ABSTRACT

We develop a technique for generating smooth and accurate 3D human pose and motion estimates from RGB video sequences. Our method, which we call Motion Estimation via Variational Autoencoder (MEVA), decomposes a temporal sequence of human motion into a smooth motion representation using auto-encoder-based motion compression and a residual representation learned through motion refinement. This two-step encoding of human motion captures human motion in two stages: a general human motion estimation step that captures the coarse overall motion, and a residual estimation that adds back person-specific motion details. Experiments show that our method produces both smooth and accurate 3D human pose and motion estimates.

研究の動機と目的

  • 最先端の3次元人体運動推定手法では関節ごとの精度は高いが、時間的滑らかさに欠けるという問題に対処する。
  • 運動推定を粗い(一般的な)成分と細かい(人物固有の)成分に分解することで、より現実的で正確な推定を実現する。
  • 滑らかで共有される人間の運動と個々の運動変動を分離する、分離された運動表現を学習する。
  • 空間的精度を損なわず、3次元ポーズシーケンスにおけるジターリングや不自然な運動アーチファクトを低減する。

提案手法

  • AMASSデータセット上で変分オートエンコーダー(VAE)を訓練し、滑らかで一般的な人間の運動を表す低次元の潜在空間を学習する。
  • 未知の運動変動に強い対応を図るため、データオーグメンテーション(ランダムなルート回転、フレームレートの変動、左右反転)を用いてVAEをファインチューニングする。
  • VAEの潜在コードをデコードすることで、全体的な滑らかな運動軌道を表す粗い運動推定値を生成する。
  • 動きの補正レジレッサー(MRR)を訓練し、動画フレームからの画像的証拠を用いて粗い推定からの残差オフセットを予測する。
  • 最終的な3次元ポーズシーケンスは、VAEが生成する粗い運動にMRRが予測した残差を加算することで得られる。
  • フレームワーク全体は二段階で訓練される:まずVAEを事前学習し、その後、凍結されたVAEの上にMRRを共同で訓練する。

実験結果

リサーチクエスチョン

  • RQ1二段階の運動推定フレームワークは、3次元人体ポーズ推定における空間的精度を損なわず、時間的滑らかさを向上させることができるか?
  • RQ2VAEを用いた運動圧縮ステップは、一般的人間運動の本質的な滑らかさを効果的に捉えられるか?
  • RQ3人物固有の精緻化モジュールは、一般運動モデルが捉えきれない運動詳細をどの程度回復できるか?
  • RQ4事前学習済みのVAE潜在空間を用いることで、エンドツーエンド学習と比較して一般化性能が向上し、運動学的に不適切なポーズが減少するか?

主な発見

  • MEVAは、先行する最先端手法と比較して3DPWデータセットにおいて加速度誤差を54.3%低減し、運動の滑らかさが著しく向上した。
  • アブレーションスタディの結果、事前学習済みのVAEを用いることで、より安定的で現実的な運動シーケンスが得られ、エンドツーエンド学習で見られる運動学的に不適切なポーズを回避できた。
  • 変分運動推定器(VME)のみを訓練しても、HMMR(先行するSOTA手法)と同等の低加速度誤差性能を達成した。
  • VAE事前学習時にランダムなルート回転、フレームレートの変動、左右反転を組み合わせることで、未知の3DPWシーケンスにおけるVAE再構成誤差が最大70%まで低減された。
  • MEVAは3DPWにおけるPA-MPJPEを54.7に達成し、精度と滑らかさの両面で先行手法を上回った。
  • 可視化結果から、粗い運動が全体的な運動トレンドを捉え、残差精緻化により突然の腕の振りや頭の回転といった動的な人物固有の詳細が回復されていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。