Skip to main content
QUICK REVIEW

[論文レビュー] Neural Rendering and Reenactment of Human Actor Videos

Lingjie Liu, Weipeng Xu|arXiv (Cornell University)|Sep 11, 2018
Advanced Vision and Imaging参考文献 72被引用数 10
ひとこと要約

本論文では、高精細な3Dスキャンを必要とせず、単眼動画と中程度の品質の3Dテンプレートモデルのみを用いて、人間のアクターのビデオリアリスティックな再現を学習ベースで実現する手法を提案する。動きキャプチャされたポーズシーケンスを用いて、合成レンダリングを写真のようにリアルな画像に翻訳する条件付きGANを訓練することで、アイデンティティを保持したビデオ合成において最先端の結果を達成し、1フレームあたり68msというリアルタイム推論を実現した。

ABSTRACT

We propose a method for generating video-realistic animations of real humans under user control. In contrast to conventional human character rendering, we do not require the availability of a production-quality photo-realistic 3D model of the human, but instead rely on a video sequence in conjunction with a (medium-quality) controllable 3D template model of the person. With that, our approach significantly reduces production cost compared to conventional rendering approaches based on production-quality 3D models, and can also be used to realistically edit existing videos. Technically, this is achieved by training a neural network that translates simple synthetic images of a human character into realistic imagery. For training our networks, we first track the 3D motion of the person in the video using the template model, and subsequently generate a synthetically rendered version of the video. These images are then used to train a conditional generative adversarial network that translates synthetic images of the 3D model into realistic imagery of the human. We evaluate our method for the reenactment of another person that is tracked in order to obtain the motion data, and show video results generated from artist-designed skeleton motion. Our results outperform the state-of-the-art in learning-based human image synthesis. Project page: http://gvv.mpi-inf.mpg.de/projects/wxu/HumanReenactment/

研究の動機と目的

  • 高品質な3Dモデルを必要とせず、ユーザーのコントロールで現実の人物のビデオリアリスティックなアニメーションを可能にすること。
  • 従来の写真のようにリアルな3Dレンダリングパイプラインと比較して、制作コストと複雑さを低減すること。
  • 既存の動画をリアルに編集可能にし、1人のアクターの動きを別のアクターに転送できること。
  • 深層学習を用いて、合成された3Dレンダリングと実際の動画の外観のギャップを埋めること。
  • インタラクティブでリアルタイムのポーズ編集と高解像度出力生成を可能にすること。

提案手法

  • 単眼の静止ポーズ動画から、スケルトンが付加されたテクスチャ付き3D表面モデルを再構築する。
  • 変更を加えた単眼人間パフォーマンスキャプチャ法を用いて、動き動画におけるアクターの3D動きを追跡する。
  • 追跡されたポーズを用いて、3Dモデルからカラー画像、深度マップ、セマンティックセグメンテーションをレンダリングすることで、訓練データを合成する。
  • 条件付き生成対抗ネットワーク(cGAN)を訓練し、合成レンダリングを対象人物の写真のようにリアルな画像に翻訳する。
  • 複雑なポーズ間での特徴一致と外観転送を向上させるために、cGANにアテンション機構を統合する。
  • 推論段階では、ユーザー定義の動き(例:MoCap、動画、スケルトン)で3Dモデルをアニメートし、条件入力をレンダリングし、訓練済みネットワークを介してリアルな動画を生成する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークは、高級な3Dモデルを必要とせず、低精細な3Dレンダリングを写真のようにリアルな人間の動画に翻訳できるか?
  • RQ2ソース動画の動きを、アイデンティティと外観を保持したまま、別のアクターに正確に転送できるか?
  • RQ3学習された画像翻訳フレームワークを用いて、リアルタイムでインタラクティブな動画編集が可能になるか?
  • RQ4極端なポーズ、隠蔽、トラッキングエラーなどの状況では、この手法にどのような限界があるか?
  • RQ5単一の参照画像のみで、任意の被写体に一般化可能か、それとも人物固有の訓練に限定されるか?

主な発見

  • 本手法は、画像ベースの人物動画合成において最先端の性能を達成し、先行する学習ベースの手法を上回った。
  • ネットワークの推論時間は1フレームあたりたったの68msであり、リアルタイムでのインタラクティブなポーズ編集を可能にした。
  • 512×512ピクセルの高解像度出力が得られ、解像度を高める代わりにトレーニング時間が長くなるが、シャープネスが向上した。
  • 失敗事例として、大きなポーズ変化、トラッキングエラー、まれなまたは隠蔽されたポーズによる手や足のアーチファクトが観察された。
  • 時間的フレームワークの揺らぎや局所的な高周波数アーチファクトが継続しており、現在のGANアーキテクチャが動画合成に限界をもつことが示唆された。
  • フレームの連結による時間的文脈の統合は、結果の向上に顕著な寄与を示さなかったため、より洗練された時間的モデリングの必要性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。