Skip to main content
QUICK REVIEW

[論文レビュー] FaR-GAN for One-Shot Face Reenactment

Hanxiang Hao, Sriram Baireddy|arXiv (Cornell University)|May 13, 2020
Face recognition and analysis参考文献 32被引用数 11
ひとこと要約

FaR-GANは、1枚のソースアイデンティティ画像と顔のランドマークマスクのみを用いて、ターゲットの表情を持つ写真のようにリアルな顔画像を生成するワンショット顔リエンアクティョングモデルを提案する。生成敵ネットワーク(GAN)アーキテクチャを採用し、畳み込み層からの学習可能な特徴量をSPADEモジュール、自己注意機構、ノイズ注入に用いることで、VoxCeleb1で最先端のFID(27.1)とSSIM(0.68)を達成し、従来手法に比べて画像品質とアイデンティティ保持性の両面で優れている。

ABSTRACT

Animating a static face image with target facial expressions and movements is important in the area of image editing and movie production. This face reenactment process is challenging due to the complex geometry and movement of human faces. Previous work usually requires a large set of images from the same person to model the appearance. In this paper, we present a one-shot face reenactment model, FaR-GAN, that takes only one face image of any given source identity and a target expression as input, and then produces a face image of the same source identity but with the target expression. The proposed method makes no assumptions about the source identity, facial expression, head pose, or even image background. We evaluate our method on the VoxCeleb1 dataset and show that our method is able to generate a higher quality face image than the compared methods.

研究の動機と目的

  • 1枚のソースアイデンティティ画像しか利用できないワンショット顔リエンアクティョングの課題に対処すること。
  • アイデンティティ、ポーズ、背景に関する仮定を一切設けずに、高品質なアイデンティティ保持性と表情の正確性を備えた写真のようにリアルな顔画像を生成すること。
  • 従来のGANベースの手法や3Dモデリング手法と比較して、画像品質を向上させ、アーチファクトを低減すること。
  • アイデンティティ固有のトレーニングデータを必要とせず、顔のランドマークのみを制御信号として用いることで、柔軟なリエンアクティョングを可能にすること。
  • 自己注意機構やノイズ注入といったアーキテクチャ的要素がリエンアクティョングの忠実度に与える影響を調査すること。

提案手法

  • モデルは、コンテンツエンコーダ、スタイルエンコーダ、およびトランスフォーマーネットワークを組み合わせた生成器を有するGANフレームワークを採用し、ターゲットの表情を合成する。
  • ランドマークマスクを条件付き入力として用い、部品ごとの意味的分離を実現するための輪郭表現が、バイナリマスクよりも優れた性能を示す。
  • SPADEモジュールは、マルチスケールのランドマークマスクではなく、中間畳み込み層からの学習可能な特徴量に条件付けられるため、より正確な空間的制御が可能になる。
  • 自己注意モジュールを生成器に統合することで、長距離特徴モデリングが向上し、空間的整合性が向上する。
  • 復元プロセス中にノイズ注入を適用することで、髪やテクスチャ領域などの高周波数ディテールが豊かになる。
  • 識別器はエンドツーエンドで学習され、実画像と生成画像を区別するように訓練され、生成器が写真のようにリアルな画像を生成するように導く。

実験結果

リサーチクエスチョン

  • RQ1GANベースのモデルは、1枚のソース画像と顔のランドマークのみを用いて、高忠実度のワンショット顔リエンアクティョングを達成できるか?
  • RQ2マルチスケールのマスクの代わりに学習可能な畳み込み特徴量を用いることで、リエンアクティョング品質にどのような影響を与えるか?
  • RQ3自己注意機構とノイズ注入は、ワンショット顔リエンアクティョングにおける画像品質の向上とアーチファクトの低減にどの程度寄与するか?
  • RQ4事前仮定を設けずに、多様なアイデンティティ、表情、ポーズにおいて、モデルはどの程度の性能を示すか?
  • RQ5輪郭表現とバイナリマスクといった異なるランドマーク表現形式が、最終的なリエンアクティョング品質に与える影響は何か?

主な発見

  • FaR-GANモデルは、VoxCeleb1データセットでFréchet Inception Distance(FID)27.1、Structural Similarity Index(SSIM)0.68を達成し、ベースライン手法を上回っている。
  • 輪郭ベースのランドマーク表現は、バイナリマスク(FID 52.1)よりも顕著に優れたFID(27.1)を達成しており、部品ごとの意味的情報を通じた分離性の向上が裏付けられている。
  • アブレーションスタディの結果、自己注意機構とノイズ注入の両方を有効にすると、FIDは63.9(両なし)から27.1に低下し、視覚的品質が向上し、アーチファクトが減少することが確認された。
  • 視覚的結果から、ノイズ注入により髪や顔のテクスチャ領域の高周波数ディテールが強化されていることが、差分画像解析によって裏付けられている。
  • 顔のポーズや表情の変化が著しくても、アイデンティティ、背景、衣装の保持が維持されており、リエンアクティョングの忠実度が保たれている。
  • 強力な性能を発揮しているものの、ソースとターゲットのアイデンティティが性別や顔のサイズで著しく異なる場合にはアイデンティティギャップが残っており、さらなる最適化の余地がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。