Skip to main content
QUICK REVIEW

[論文レビュー] Geometry Guided Adversarial Facial Expression Synthesis

Lingxiao Song, Zhihe Lu|arXiv (Cornell University)|Dec 10, 2017
Face recognition and analysis被引用数 16
ひとこと要約

本論文では、顔の顔面特徴点をヒートマップに変換した条件付き入力を用いて、写真のようにリアルで顔の識別性を保った表情を合成する幾何学的ガイダンス付き生成対抗ネットワーク、G2-GANを提案する。2つのGANサブネットワーク(表情合成と表情除去)を共同で学習させ、サイクル整合性のあるマッピングを形成することで、最先端の性能を示す表情転送と識別子不変顔認識を実現した。CK+およびOulu-CASIAデータセットで評価した。

ABSTRACT

Facial expression synthesis has drawn much attention in the field of computer graphics and pattern recognition. It has been widely used in face animation and recognition. However, it is still challenging due to the high-level semantic presence of large and non-linear face geometry variations. This paper proposes a Geometry-Guided Generative Adversarial Network (G2-GAN) for photo-realistic and identity-preserving facial expression synthesis. We employ facial geometry (fiducial points) as a controllable condition to guide facial texture synthesis with specific expression. A pair of generative adversarial subnetworks are jointly trained towards opposite tasks: expression removal and expression synthesis. The paired networks form a mapping cycle between neutral expression and arbitrary expressions, which also facilitate other applications such as face transfer and expression invariant face recognition. Experimental results show that our method can generate compelling perceptual results on various facial expression synthesis databases. An expression invariant face recognition experiment is also performed to further show the advantages of our proposed method.

研究の動機と目的

  • 表情の強度と種類に細かく制御可能な高精細で識別子を保つ顔の表情生成の課題に対処すること。
  • 既存のGANベース手法が顔の幾何学的制御に欠け、しばしばぼやけたまたは低解像度の出力を生成するという限界を克服すること。
  • サイクル整合性フレームワークを用いて、双方向の顔の編集(表情合成と表情除去)を可能にすること。
  • 提案された除去モデルを用いて顔の表情を中立に正規化することで、表情不変顔認識を向上させること。
  • 個々の顔の幾何学的特徴をモデル化することで、表情転送中に独自の識別特徴を保つこと。

提案手法

  • 顔の特徴点のヒートマップ表現を、表情合成と除去の両方の生成器をガイドする条件付き入力として使用する。
  • 2つの敵対的サブネットワークを共同で学習する:1つは中立顔から目的の表情を生成するもの、もう1つは表情を除去して中立顔を回復するもの。
  • 表情除去後に再び合成することで元の入力を回復するよう、サイクル整合性損失を適用し、特徴量と識別子の保持を強化する。
  • 潜在空間における特徴レベルの制約を用いて、表情変更の間でも被験者の識別子を維持するための識別子保持損失を用いる。
  • 個々の顔の形状モデルを学習して顔の幾何学的構造を表現・操作可能とし、パーソナライズされた表情編集と補間を可能にする。
  • 2つのサブネットワークを活用することで、表情転送、補間、表情不変顔認識などの応用が可能になる。

実験結果

リサーチクエスチョン

  • RQ1特徴点のヒートマップとして表現された顔の幾何学的特徴が、写真的で識別子を保つ顔の表情合成を効果的にガイドできるか?
  • RQ2表情合成と除去の間でサイクル整合性学習を適用することで、生成された顔画像の品質と一貫性がどのように向上するか?
  • RQ3提案手法が、笑顔と驚きの表情を区別できるような、表情の強度と種類に対する細かく制御可能な性能をどの程度実現できるか?
  • RQ4表情除去サブネットワークが、表情不変顔認識のための効果的な正規化モジュールとして機能できるか?
  • RQ5個々の顔の幾何学的特徴モデリングが、顔の表情転送におけるリアリズムと識別子保持性をどの程度向上させるか?

主な発見

  • CK+データセットでは、VGG-Faceを用いた場合のRank-1識別率が97.26%、Light CNNを用いた場合が100.00%(TAR@FAR=1%)に達し、元の設定を上回った。
  • Oulu-CASIAデータセットでは、VGG-Faceを用いた場合のRank-1率が97.84%、Light CNNを用いた場合が99.88%(TAR@FAR=1%)に達し、顔の表情不変認識において優れた性能を示した。
  • 除去実験では、サイクル整合性損失($L_{cyc}$)や識別子損失($L_{identity}$)を除いた場合に性能が低下したことが確認され、これらが強固な表情編集に不可欠であることが裏付けられた。
  • モデルは、笑顔の場合は実際の歯が見えるように、驚きの表情ではそうでないように、口の変形を明確に生成し、顔の詳細に対する細かな制御を示した。
  • 表情補間の結果、CK+では7つの表情クラス、Oulu-CASIAでは6つの表情クラスで滑らかな遷移が得られ、一貫性のある識別子を保った中間表情の生成が可能であることが確認された。
  • フレームワークにより、任意の表情と被験者間での顔の表情転送が有効に実現され、両データセットにおける定性的および定量的評価で裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。