Skip to main content
QUICK REVIEW

[論文レビュー] Video synthesis of human upper body with realistic face

Zhaoxiang Liu, Huan Hu|arXiv (Cornell University)|Aug 19, 2019
Generative Adversarial Networks and Image Synthesis参考文献 20被引用数 7
ひとこと要約

この論文は、元の動画の動き、顔の表情、ポーズを保持しながら、対象者の上半身動画を写実的につくるGANベースの手法を提案する。顔の動き素因(FAUP)と上半身キーポイント(UBKP)を中間表現として活用し、アイデンティティに依存しないFAUPを介して、元の表情を対象のアイデンティティにマッピングする。その後、空間的・時間的滑らかさと知覚的損失を組み込んだ変更版pix2pixHDフレームワークを用いて、時間的に整合的で高精細な動画を生成し、実現可能な顔の再現と動きの転送を達成する。

ABSTRACT

This paper presents a generative adversarial learning-based human upper body video synthesis approach to generate an upper body video of target person that is consistent with the body motion, face expression, and pose of the person in source video. We use upper body keypoints, facial action units and poses as intermediate representations between source video and target video. Instead of directly transferring the source video to the target video, we firstly map the source person's facial action units and poses into the target person's facial landmarks, then combine the normalized upper body keypoints and generated facial landmarks with spatio-temporal smoothing to generate the corresponding target video's image. Experimental results demonstrated the effectiveness of our method.

研究の動機と目的

  • 元の動画からの動き、顔の表情、ポーズを保持しながら、対象者の写実的上半身動画を生成する課題に対処すること。
  • 直接的な画像間変換による方法では、動きの詳細が失われたり、顔のテクスチャが現実的でなくなったりするという従来手法の限界を克服すること。
  • 3Dモーションキャプチャに依存せずに、身体の動きの転送と高精細な顔の再現を統合する包括的なパイプラインを開発すること。
  • 顔の動き素因(FAUP)をアイデンティティに依存しない中間表現として用いることで、身体の動きと顔の表情の滑らかな統合を実現すること。
  • 空間的・時間的滑らかさと知覚的損失関数を用いて、生成された動画シーケンスの時間的整合性と視覚的品質を保証すること。

提案手法

  • 事前学習済みのポーズ検出器を用いて、元の動画から上半身キーポイント(UBKP)を推定し、顔の動き素因(FAUP)を抽出する。これらを中間表現として用いる。
  • 学習された変換を用いて、元のFAUPを対象の顔のランドマークにマッピングする。FAUPのアイデンティティに依存しない性質を活かし、複雑な正規化を回避する。
  • 正規化されたUBKPと生成された顔のランドマーク(UBKP-FL)を連結して、動画生成の条件入力を構築する。
  • 敵対的損失 $ L_{GAN} $、$ L_1 $ 再構成損失、および知覚的損失 $ L_{VGG} $ を用いて、変更版pix2pixHDネットワークを訓練し、高精細な画像を生成する。
  • 時間的滑らかさ損失 $ L_{tS} $ を導入し、過去の元のフレームと以前に生成されたフレームの両方に条件付けられたフレーム生成を実現することで、時間的整合性を確保する。
  • 特徴マッチング損失 $ L_{FM} $ を適用し、複数の損失を統合的な目的関数に組み合わせる:$ ext{min}_G ext{max}_D ig( ext{sum of } L_{tS}, L_{FM}, L_{VGG} ig) $。

実験結果

リサーチクエスチョン

  • RQ1顔の動き素因(FAUP)は、顔の表情を元から対象に転送するための効果的で、アイデンティティに依存しない中間表現として機能するか?
  • RQ2身体の動きと顔の表情を同時に転送しながら、写実的で時間的整合性のある動画合成を達成するにはどうすればよいか?
  • RQ3UBKPとFAUPを用いたGANベースのフレームワークは、単独の顔再現モデルと身体再現モデルを単純に結合した手法よりも優れた結果を達成できるか?
  • RQ4提案された時間的滑らかさ損失は、生成された動画シーケンスの視覚的品質と一貫性をどの程度向上させるか?
  • RQ5知覚的損失、敵対的損失、および $ L_1 $ 損失の組み合わせは、合成された上半身動画のリアリズムと忠実度にどのような影響を与えるか?

主な発見

  • 本手法は、元の動画の動き、表情、ポーズと整合的で、写実的な対象者の上半身動画を効果的に生成できた。
  • FAUPを中間表現として用いることで、アイデンティティ間の複雑な正規化を必要とせずに、正確な顔の表情転送が可能になった。
  • 過去のフレームを用いた時間的滑らかさ処理により、生成された動画シーケンスの視覚的品質が著しく向上し、ちらつきや不整合が低減された。
  • $ L_{VGG} $、$ L_{FM} $、$ L_{tS} $ 損失の組み合わせは、ベースラインのGANと比較して、よりリアリストで知覚的に正確な結果をもたらした。
  • 顔再現モデルと身体再現モデルを単純に統合する手法に比べ、本フレームワークは動きと顔の詳細の滑らかな統合を達成し、優れた性能を発揮した。
  • 強力な性能を発揮する一方で、本手法は計算コストが高く、今後の研究では軽量なアーキテクチャの開発が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。