Skip to main content
QUICK REVIEW

[論文レビュー] High-resolution Face Swapping via Latent Semantics Disentanglement

Yangyang Xu, Bailin Deng|arXiv (Cornell University)|Mar 30, 2022
Face recognition and analysis被引用数 6
ひとこと要約

本論文は、StyleGANの潜在空間における意味的分離を図ることで、構造的属性(ポーズ、表情)と外見的属性(照明、肌色)を分離する高解像度顔交換手法を提案する。ランドマーク誘導型潜在方向転送とマルチスケール特徴融合を用い、画像および動画における顔交換で最先端の結果を達成し、幻覚の質と時間的整合性が向上し、従来のGANベース手法に比して忠実度と詳細の保持において優れている。

ABSTRACT

We present a novel high-resolution face swapping method using the inherent prior knowledge of a pre-trained GAN model. Although previous research can leverage generative priors to produce high-resolution results, their quality can suffer from the entangled semantics of the latent space. We explicitly disentangle the latent semantics by utilizing the progressive nature of the generator, deriving structure attributes from the shallow layers and appearance attributes from the deeper ones. Identity and pose information within the structure attributes are further separated by introducing a landmark-driven structure transfer latent direction. The disentangled latent code produces rich generative features that incorporate feature blending to produce a plausible swapping result. We further extend our method to video face swapping by enforcing two spatio-temporal constraints on the latent space and the image space. Extensive experiments demonstrate that the proposed method outperforms state-of-the-art image/video face swapping methods in terms of hallucination quality and consistency. Code can be found at: https://github.com/cnnlstm/FSLSD_HiRes.

研究の動機と目的

  • 高解像度において顔交換品質を低下させる、StyleGAN潜在空間における意味的エンタングルメントの課題に対処すること。
  • より自然な顔交換を実現するため、アイデンティティ、構造(ポーズ/表情)、外見(照明/肌色)を正確に分離すること。
  • StyleGANの段階的・粗いから細かい生成の性質を活用して、特徴の制御を向上させ、高解像度顔交換を改善すること。
  • 時間的整合性を保つ動画顔交換へと手法を拡張することにより、フレーム単位の不整合を回避すること。

提案手法

  • StyleGANの段階的生成特性を活用し、浅い層の構造的属性(ポーズ、表情)を深い層の外見的属性(照明、肌色)から分離する。
  • ソースおよびターゲット顔のキーポoinト埋め込みから導出されるランドマーク誘導型構造転送潜在方向を導入し、構造転送をガイドする。
  • ターゲットの外見コードを、構造転送済みのソース潜在コードと再編成することで、ソースのアイデンティティを保持しつつ、ターゲットの構造と外見を採用する。
  • 生成特徴とエンコード済みターゲット特徴を統合するマルチスケール特徴集約機構を採用し、ブレンドアーチファクトを低減する。
  • 動画顔交換のための2つの空間的時間的制約を強制する:浅い層における潜在オフセットのコード軌道制約と、RGB空間におけるフロー軌道制約。
  • 構造的不一致に耐性を持つターゲットエンコーダ・デコーダを用い、背景および顔領域のブレンドを安定化させる。

実験結果

リサーチクエスチョン

  • RQ1StyleGANにおける潜在的意味分離を図ることで、アイデンティティ、構造、外見属性の分離が高解像度顔交換の品質向上に寄与するか?
  • RQ2ランドマーク誘導型潜在方向転送は、ソースアイデンティティを保持しつつ、正確な構造転送を可能にするか?
  • RQ3顔交換におけるフレーム間の一貫性を維持するのに有効な空間的時間的制約は何か?
  • RQ4マルチスケール特徴融合は、高解像度顔交換におけるブレンドアーチファクトをどの程度低減できるか?
  • RQ5提案手法は、画像および動画顔交換ベンチマークで最先端の性能を達成できるか?

主な発見

  • 提案手法は、MegaFSなどのベースライン手法と比較して、幻覚やぼやけの著しい低減を実現し、高解像度顔交換で最先端の性能を達成した。
  • 定性的な結果から、外見転送や背景統合を欠如させたアブレーションバージョンでは、不自然なスタイルや目立つブレンド境界が生じることが確認され、提案された構成要素の必要性が裏付けられた。
  • 複数のデータセットにおける定性的比較により、ソースアイデンティティを正確に保持しつつ、ターゲットの顔の構造と外見を的確に転送できていることが実証された。
  • コード軌道制約とフロー軌道制約の2つの空間的時間的制約により、動画顔交換におけるフレーム間整合性が顕著に向上し、フレーム単位のベースラインで見られる不整合が解消された。
  • 広範な実験により、特に繊細な顔のテクスチャや背景統合において、優れた視覚的品質と詳細の保持が実現され、既存のGANベース顔交換手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。