Skip to main content
QUICK REVIEW

[論文レビュー] Vid2Actor: Free-viewpoint Animatable Person Synthesis from Video in the Wild

Chung-Yi Weng, Brian Curless|arXiv (Cornell University)|Dec 23, 2020
Human Pose and Action Recognition参考文献 41被引用数 22
ひとこと要約

Vid2Actorは、野生の状況下での1つの非構造的映像から、自由視点で見られる、アニメーション可能な3D人体ボリュームを再構築する自己教師付き深層学習手法を提案する。正規化されたRGBαボリュームとポーズ依存のモーションウェイトを学習することで、3Dの教師信号を一切必要とせず、高品質な新しいポーズと視点の再構築を可能にし、最小限のアーチファクトで多様な実世界の映像に対してモーションレターキングとブルートタイムレンダリングを実現する。

ABSTRACT

Given an "in-the-wild" video of a person, we reconstruct an animatable model of the person in the video. The output model can be rendered in any body pose to any camera view, via the learned controls, without explicit 3D mesh reconstruction. At the core of our method is a volumetric 3D human representation reconstructed with a deep network trained on input video, enabling novel pose/view synthesis. Our method is an advance over GAN-based image-to-image translation since it allows image synthesis for any pose and camera via the internal 3D representation, while at the same time it does not require a pre-rigged model or ground truth meshes for training, as in mesh-based learning. Experiments validate the design choices and yield results on synthetic data and on real videos of diverse people performing unconstrained activities (e.g. dancing or playing tennis). Finally, we demonstrate motion re-targeting and bullet-time rendering with the learned models.

研究の動機と目的

  • 3Dの教師信号や事前リグgedモデルを必要とせず、制約のない、野生の状況下の映像からアニメーション可能な自由視点3次元人体再構築を可能にすること。
  • 限られた、多様でキャリブレーションのないデータからの1つの映像から、新しいポーズと視点を合成する課題に対処すること。
  • 画像観測のみを用いて、ポーズとカメラの視点の多様な変化に一般化可能な自己教師付きフレームワークを開発すること。
  • 学習された3次元表現を用いた実用的応用、例えばモーションレターキングとブルートタイムレンダリングの実証すること。

提案手法

  • 本手法は、学習された正規化されたRGBαボリュームとポーズ依存のボリュームモーションウェイトのセットとして人物を表現し、新しいポーズと視点への再投影を可能にする。
  • 深層ニューラルネットワークを、L1損失、ペルセプトゥアル損失、敵対的損失の組み合わせを用いて、映像フレーム上でエンドツーエンドに学習し、正規化されたボリュームとモーションウェイトを予測する。
  • フレームワークは、低解像度入力から高解像度3次元幾何を再構築するためにボリュームワープを活用し、先行するボリュームベースのNVSR手法のアイデアを応用する。
  • 3Dメッシュ、SMPLパラメータ、マルチビューキャリブレーションの真値を一切必要とせず、映像フレームのみを用いて自己教師付きで学習する。
  • 学習されたモーションウェイトを正規化ボリュームに適用することで、ボディポーズとカメラ角度の明示的制御を実現する。
  • モーションレターキングとブルートタイムレンダリングには、3次元人体ポーズ推定の出力を用い、カメラパスを被写体の周囲で回転させる。

実験結果

リサーチクエスチョン

  • RQ13Dの教師信号や事前リグgedモデルを必要とせず、1つの非構造的映像から3次元人体表現を学習可能か?
  • RQ2自己教師付きネットワークは、学習時に見られなかった新しいポーズと視点にどの程度一般化できるか?
  • RQ3学習されたボリューム表現は、明示的な3次元再構築を伴わず、高品質なモーションレターキングとブルートタイムレンダリングをサポートできるか?
  • RQ4制約のない映像から自由視点再構築において、外観と詳細を保持するのに最も効果的な損失関数は何か?
  • RQ5入力映像内のポーズと視点の多様性が、再構築された3次元モデルの品質にどのように影響するか?

主な発見

  • 本手法は、ダンスやテニスプレーのシーケンスを含む多様な実世界の映像において、高品質な新しい視点とポーズの再構築を達成しており、たった300フレーム程度の入力でも効果を発揮する。
  • ペルセプトゥアル損失は、特に顔貌や身体の詳細において、レンダリング品質を顕著に向上させる。これは定性的なアブレーションスタディで示された。
  • モーションキャプチャデータを学習済みモデルに適用することで、モーションレターキングが効果的に実現され、任意のポーズでのリアルなアニメーションが可能になる。
  • 予測された3次元ポーズを用いてカメラを被写体の周囲で回転させることでブルートタイムレンダリングが成功し、非正面および複雑なポーズにおいてPIFuやPIFuHDを上回る性能を示す。
  • 未学習の設定に対しても良好に一般化され、入力映像の長さとポーズの多様性が増すほど、結果が向上する。
  • ポーズ依存の外観やスペキュラー効果の処理に限界は存在するが、広範な視点とポーズにおいて、再構築結果は妥当で視覚的に説得力を持つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。