Skip to main content
QUICK REVIEW

[論文レビュー] AOT: Appearance Optimal Transport Based Identity Swapping for Forgery Detection

Hao Zhu, Chaoyou Fu|arXiv (Cornell University)|Nov 5, 2020
Generative Adversarial Networks and Image Synthesis参考文献 68被引用数 16
ひとこと要約

本稿では、顔の外見の変動が著しい状況下でもリアルなDeepfakeを生成できる、Appearance Optimal Transport (AOT) という新しいアイデンティティ交換手法を提案する。AOTは、潜在空間およびピクセル空間の両方で外見マッピングを最適輸送問題として定式化することで、顕著な外見差異を伴うリアルなDeepfakeの生成を実現する。リライティング生成器とセグメンテーションゲームを活用し、特徴空間およびピクセル空間におけるWasserstein距離を最小化することで、SOTA手法に比べて優れたリアルさと耐障害性を達成し、多様な外見条件下での偽造検出の一般化性能を顕著に向上させる。

ABSTRACT

Recent studies have shown that the performance of forgery detection can be improved with diverse and challenging Deepfakes datasets. However, due to the lack of Deepfakes datasets with large variance in appearance, which can be hardly produced by recent identity swapping methods, the detection algorithm may fail in this situation. In this work, we provide a new identity swapping algorithm with large differences in appearance for face forgery detection. The appearance gaps mainly arise from the large discrepancies in illuminations and skin colors that widely exist in real-world scenarios. However, due to the difficulties of modeling the complex appearance mapping, it is challenging to transfer fine-grained appearances adaptively while preserving identity traits. This paper formulates appearance mapping as an optimal transport problem and proposes an Appearance Optimal Transport model (AOT) to formulate it in both latent and pixel space. Specifically, a relighting generator is designed to simulate the optimal transport plan. It is solved via minimizing the Wasserstein distance of the learned features in the latent space, enabling better performance and less computation than conventional optimization. To further refine the solution of the optimal transport plan, we develop a segmentation game to minimize the Wasserstein distance in the pixel space. A discriminator is introduced to distinguish the fake parts from a mix of real and fake image patches. Extensive experiments reveal that the superiority of our method when compared with state-of-the-art methods and the ability of our generated data to improve the performance of face forgery detection.

研究の動機と目的

  • 挑戦的な照明条件や肌色の違いを伴う、顕著な外見変動を持つDeepfakeデータセットの不足に取り組むこと。
  • 顕著な外見差異を伴う多様でリアルなDeepfakeの生成により、顔偽造検出モデルの耐障害性を向上させること。
  • 従来の最適輸送手法がアイデンティティ交換において抱える限界、例えば不連続な合成、高コストな計算、幾何的保存性の低さを克服すること。
  • 微細な外見転送を実現するため、最適輸送と深層生成モデリングを統合したスケーラブルで微分可能フレームワークを開発すること。
  • 既存のアイデンティティ交換パイプラインと互換性があり、複雑な外見条件下での性能向上を図るプラグインソリューションを提供すること。

提案手法

  • 顔の外見マッピングを、潜在空間およびピクセル空間の両方で最適輸送問題として定式化し、複雑な外見変換をモデル化する。
  • アイデンティティ保持の特徴学習を支援するため、3次元顔の幾何構造と照明情報を統合した2本の分岐型の知覚エンコーダを導入する。
  • 潜在空間におけるWasserstein距離を最小化するためのNeural Optimal Transport Plan Estimation (NOTPE) を提案し、効率的で連続的な合成を実現する。
  • リライティング生成器を用いて特徴をピクセル空間にデコードし、セグメンテーションゲームを活用して外見転送を精緻化する。
  • セグメンテーションゲームにディスクライマーを組み込み、本物と偽物の画像パッチを区別させることで、生成器がよりリアルな出力を生成するよう促進する。
  • 本物と偽物の画像パッチの混合を用いてディスクライマーを学習させ、生成器がターゲットの外見と一致する写真的リアリズムを持つ出力を生成するよう強制する。

実験結果

リサーチクエスチョン

  • RQ1肌色や照明条件の違いといった顕著な外見差異を伴うアイデンティティ交換に、最適輸送を効果的に応用できるか。
  • RQ2従来の最適輸送の計算負荷を軽減しつつ、顔交換におけるアイデンティティおよび構造的忠実性を維持できるか。
  • RQ3潜在空間とピクセル空間の両方で最適化を実施することで、単一空間アプローチに比べて生成されたDeepfakeのリアルさと連続性が向上するか。
  • RQ4提案手法が、未観測の外見変動にさらされた状況下でも、顔偽造検出モデルの一般化性能をどの程度向上させるか。
  • RQ5AOTフレームワークは、既存のアイデンティティ交換パイプラインにシームレスに統合可能か。

主な発見

  • AOTは、肌色や照明の不一致といった顕著な外見差異下でも、SOTAのアイデンティティ交換手法を著しく上回るリアルな顔交換を実現する。
  • DeepFaceLab や従来の最適輸送手法と比較して、より優れた視覚的品質と、より少ないアーティファクト、より一貫性のある肌色を達成する。
  • 潜在空間およびピクセル空間の両方でWasserstein距離を最小化することで、滑らかで連続的な外見転送が実現され、計算コストも低減される。
  • 敵対的訓練を用いたセグメンテーションゲームにより、ピクセルレベルのリアリズムが効果的に精緻化され、生成画像が本物と見分けがつかないレベルにまで向上する。
  • 生成されたDeepfakeデータは、下流の顔偽造検出モデルの耐障害性を向上させ、特に未観測の外見分布下でも顕著な効果を示す。
  • AOTは既存のアイデンティティ交換フレームワークと互換性があり、プラグインとして統合可能であり、複雑な外見変動下での性能向上を図ることができる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。