[論文レビュー] Geometry-Contrastive GAN for Facial Expression Transfer
GC-GAN はジオメトリをコントラスト学習で埋め込むことにより表情の連続的な意味的潜在空間を学習し、異なる被写体間でアイデンティティを保持した表情転送を可能にする。
In this paper, we propose a Geometry-Contrastive Generative Adversarial Network (GC-GAN) for transferring continuous emotions across different subjects. Given an input face with certain emotion and a target facial expression from another subject, GC-GAN can generate an identity-preserving face with the target expression. Geometry information is introduced into cGANs as continuous conditions to guide the generation of facial expressions. In order to handle the misalignment across different subjects or emotions, contrastive learning is used to transform geometry manifold into an embedded semantic manifold of facial expressions. Therefore, the embedded geometry is injected into the latent space of GANs and control the emotion generation effectively. Experimental results demonstrate that our proposed method can be applied in facial expression transfer even there exist big differences in facial shapes and expressions between different subjects.
研究の動機と目的
- 連続的な感情表現を用いて被写体間の表情転送を動機づける。
- ジオメトリを連続的な条件として導入し、GANs における表情合成を導く。
- 対比学習を用いて顔のジオメトリを意味的潜在空間に埋め込み、被写体間のずれを減らす。
- 表情条件付き潜在変数に対して生成器のリプシッツ連続性を保証する。
- 複数のデータセットでの有効性とクロスデータセット転送シナリオを通じて示す。
提案手法
- 幾何埋め込みネットワーク E、画像生成器 G、画像判別器 D からなる三成分 GC-GAN を導入する。
- コントラスト学習を用いてジオメトリを埋め込み、z_g = E_enc(g_k^v) を得て意味的表現多様体を形成する。
- アイデンティティ潜在変数 z_i(I_j^u から) とジオメトリ潜在変数 z_g を連結して生成器の入力を形成し、リプシッツ連続性を課す。
- コントラスト損失 L_contr で E を訓練し、同じ表現のランドマークを近づけ、異なる表現を離す。
- 対立的損失(WGAN-GP)と再構成損失(画像には L_ir、ランドマークには L_gr)を組み合わせて G と E を訓練する。
- 2 段階で進行する:L_contr と L_gr で E を事前訓練し、固定した E で G と D を訓練して L_ir と L_adv を最適化する。
実験結果
リサーチクエスチョン
- RQ1連続的なジオメトリ埋め込みは、アイデンティティを保持しつつ被写体間の表情転送を導くことができるか?
- RQ2顔のジオメトリの対比的埋め込みは、意味的でリプシッツ連続な表情潜在空間を生み出し、転送品質を向上させるか?
- RQ3GC-GAN は多様なデータセットやクロスデータセットの表情転送シナリオでどのように機能するか?
- RQ4再構成損失と対立的損失が合成品質と表情忠実度に与える影響は何か?
主な発見
- GC-GAN は埋め込まれたジオメトリ潜在空間に導かれ、アイデンティティを保持する表情転送を実現する。
- L_ir、L_gr、および L_contr の組み込みは、Multi-PIE、CK+、BU-4DFE でのアブレーションや CDAAE のようなベースラインよりも SSIM と PSNR を改善する。
- ジオメトリ埋め込みは表現条件に関してリプシッツ連続な写像を生み出し、滑らかな表現遷移を促進する。
- クロスデータセット実験(CelebA が CelebA由来のランドマークを導く)により、GC-GAN はアイデンティティを保持しつつ表情を転送できることを示す。
- 三つの損失のいずれかを除去すると性能が低下することをアブレーションが示しており、再構成と対比ガイダンスの寄与を強調する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。