Skip to main content
QUICK REVIEW

[論文レビュー] One-Shot Face Reenactment on Megapixels

Won Jun Kang, Geonsu Lee|arXiv (Cornell University)|May 26, 2022
Face recognition and analysis被引用数 4
ひとこと要約

本稿では、StyleGANと3DMMベースのレンダリング画像を入力として用いることで、アイデンティティ、表情、頭部ポーズの明示的制御を可能にする、1ショットで高解像度の顔再現を行うMegaFRを提案する。ビデオを用いない損失関数を設計し、反復的リファインメントを適用することで、高品質なビデオデータセットを必要とせず、メガピクセルスケールの写実的結果を達成し、従来手法に比べて分離性と視覚的忠実度で優れる。

ABSTRACT

The goal of face reenactment is to transfer a target expression and head pose to a source face while preserving the source identity. With the popularity of face-related applications, there has been much research on this topic. However, the results of existing methods are still limited to low-resolution and lack photorealism. In this work, we present a one-shot and high-resolution face reenactment method called MegaFR. To be precise, we leverage StyleGAN by using 3DMM-based rendering images and overcome the lack of high-quality video datasets by designing a loss function that works without high-quality videos. Also, we apply iterative refinement to deal with extreme poses and/or expressions. Since the proposed method controls source images through 3DMM parameters, we can explicitly manipulate source images. We apply MegaFR to various applications such as face frontalization, eye in-painting, and talking head generation. Experimental results show that our method successfully disentangles identity from expression and head pose, and outperforms conventional methods.

研究の動機と目的

  • 1ショット顔再現のための高品質で高解像度のビデオデータセットの不足に対処すること。
  • 顔の操作を制御可能にするために、潜在空間におけるアイデンティティ、表情、ポーズの混合を克服すること。
  • 1枚のソース画像のみを用いて、高解像度(メガピクセル)の顔再現を実現すること。
  • 極端なポーズや表情に対してもアイデンティティの忠実度を維持しながら、顔再現を可能にすること。
  • 顔の前面化、目の補完、会話する顔生成などの応用を通じて制御性を示すこと。

提案手法

  • 3DMMパラメータから得られる3DMMベースのレンダリング画像を、StyleGANエンコーダの入力として用い、生の3DMMパラメータよりも解釈可能でCNNに適した特徴を提供する。
  • 知覚的およびアイデンティティ保持制約を活用することで、高品質なビデオデータセットを必要とせず学習を可能にする、新しい損失関数を採用する。
  • ReStyle風の最適化を用いた反復的リファインメントにより、極端なポーズや表情下でも再構成品質を向上させる。
  • GANの逆問題解法として、pSp、e4e、またはPTIを用いて、実際のソース画像をStyleGAN潜在空間にマッピングし、アイデンティティの詳細を保持する。
  • 3DMMパラメータによるソース画像の明示的制御により、アイデンティティ、表情、ポーズの分離された操作を可能にする。
  • StyleGANと3DMMの事前知識を統合することで、制御可能で高忠実度の顔生成および編集を実現する。

実験結果

リサーチクエスチョン

  • RQ11枚のソース画像のみを用いて、ビデオデータセットを必要とせず、メガピクセルスケールの顔再現が可能か。
  • RQ23DMMベースのレンダリング画像は、StyleGANにおける顔再現の潜在空間操作の解釈可能性と性能を向上させるか。
  • RQ3ビデオを用いない損失関数は、高解像度顔再現におけるアイデンティティと写実的品質の維持にどの程度効果的か。
  • RQ4反復的リファインメントは、1ショット再現における極端な顔の表情や頭部ポーズに対処するために効果的か。
  • RQ5本手法は、前面化や目の補完といった他の顔操作タスクへどの程度一般化可能か。

主な発見

  • MegaFRは、顔の前面化において最先端の性能を達成し、pSpを用いる際のFréchet Inception Distance (FID) は24.3、e4eを用いる際は27.2と、R&R (88.0) やpSp (62.8) より顕著に優れている。
  • pSpを用いる際の知覚的類似度(LPIPS)は0.23、e4eを用いる際は0.27であり、前面化結果の高い知覚的品質を示している。
  • 参照画像を一切使用せず、3DMMパラメータの直接操作により、目の開き具合の制御が可能であり、目の補完が成功している。
  • 1024×1024の高解像度で、正確な口唇の動きと顔の表情移動(まぶたの瞬きを含む)を伴う、会話する顔のシーケンスが生成された。
  • PTI最適化の使用により、ドメイン外の画像においてもアイデンティティのずれが低減し、微細なディテールが保持されていることが定性的な結果で示された。
  • MegaFRはアイデンティティを表情やポーズから明示的に分離できており、3DMMパラメータによる顔の属性の制御が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。