Skip to main content
QUICK REVIEW

[論文レビュー] FakeLocator: Robust Localization of GAN-Based Face Manipulations

Yihao Huang, Felix Juefei-Xu|arXiv (Cornell University)|Jan 27, 2020
Digital Media Forensic Detection被引用数 6
ひとこと要約

FakeLocatorは、アップサンプリングアーティファクトを活用することで、GANで生成された顔の改ざんを高解像度でローカライズする、革新的で頑健な手法を提案する。複数のデータセットおよびGAN手法において最先端の性能を達成し、JPEG圧縮やぼかしといった実世界の劣化に対しても強い耐性を示す。

ABSTRACT

Full face synthesis and partial face manipulation by virtue of the generative adversarial networks (GANs) and its variants have raised wide public concerns. In the multi-media forensics area, detecting and ultimately locating the image forgery has become an imperative task. In this work, we investigate the architecture of existing GAN-based face manipulation methods and observe that the imperfection of upsampling methods therewithin could be served as an important asset for GAN-synthesized fake image detection and forgery localization. Based on this basic observation, we have proposed a novel approach, termed FakeLocator, to obtain high localization accuracy, at full resolution, on manipulated facial images. To the best of our knowledge, this is the very first attempt to solve the GAN-based fake localization problem with a gray-scale fakeness map that preserves more information of fake regions. To improve the universality of FakeLocator across multifarious facial attributes, we introduce an attention mechanism to guide the training of the model. To improve the universality of FakeLocator across different DeepFake methods, we propose partial data augmentation and single sample clustering on the training images. Experimental results on popular FaceForensics++, DFFD datasets and seven different state-of-the-art GAN-based face generation methods have shown the effectiveness of our method. Compared with the baselines, our method performs better on various metrics. Moreover, the proposed method is robust against various real-world facial image degradations such as JPEG compression, low-resolution, noise, and blur.

研究の動機と目的

  • GANで生成された画像における偽物の顔領域を、二値検出をはるかに超えて、正確にローカライズするという重要なニーズに対応すること。
  • 従来の手法が低解像度の出力や損失のある特徴抽出により、細粒度の偽物領域の詳細を損なうという限界を克服すること。
  • さまざまな顔の属性(例:髪の色、性別)および複数のGANベースの顔の改ざん手法にわたるモデルの汎化性能を向上させること。
  • JPEG圧縮、ノイズ、ぼかし、低解像度スケーリングといった実世界の画像劣化に対して耐性を確保すること。

提案手法

  • GANベースの顔合成モデルのアップサンプリング層に内在する不完全さを、改ざんローカライズの検出可能な指紋として活用する。
  • 偽物の度合いを表すグレースケールの「偽物マップ」を出力として採用し、後処理を施さずに偽物領域の高解像度空間的詳細を保持する。
  • 顔パーツマップに従って誘導されるアテンションメカニズムを組み込むことで、多様な顔の属性にわたるクロス属性一般化を向上させる。
  • 訓練中に部分的なデータオーグメンテーションと単一サンプルクラスタリングを適用することで、異なるGANアーキテクチャ間でのクロス手法一般化を向上させる。
  • スキップ接続を備えたエンコーダ・デコーダアーキテクチャを採用し、空間解像度を維持するとともに、細粒度の改ざんパターンを再構築する。
  • 訓練を監視するために、本物と偽物の画像間の絶対差分として真値の偽物マップを計算する。

実験結果

リサーチクエスチョン

  • RQ1GANベースの顔の改ざんモデルにおけるアップサンプリングアーティファクトは、信頼性を持って高解像度の改ざんローカライズに利用可能か?
  • RQ2顔の属性(例:髪の色、性別)の変動に耐えながらも、高精度なローカライズを維持できるように、深層学習モデルをどのように設計できるか?
  • RQ3再トレーニングなしで、単一のモデルが多様なGANベースの顔生成手法にどの程度一般化できるか?
  • RQ4JPEG圧縮、ぼかし、ノイズ、低解像度スケーリングといった実世界の画像劣化下で、提案手法はどの程度の性能を示すか?

主な発見

  • FakeLocatorはFaceForensics++およびDFFDデータセットにおいて、PSNR、SSIM、ACCといった複数の指標で、既存手法を上回る最先端の性能を達成した。
  • 深刻な画像劣化後でも高いローカライズ精度を維持している:JPEG圧縮やノイズ下でもPSNRが安定しており、極端な条件下でもSSIMとACCはわずかに低下するにとどまる。
  • 不規則配置テストにより、モデルの位置不変性が確認された。偽物画像のパッチを再配置しても性能低下はわずかにとどまり、モデルが空間的ヒントではなくテクスチャベースのパターンを学習していることが示された。
  • 顔パーツマップに従って誘導されるアテンションメカニズムは、特に「光沢なし(bald)」や「ひげ(beard)」といったレアまたは複雑な属性において、クロス属性一般化を顕著に向上させた。
  • 部分的なデータオーグメンテーションと単一サンプルクラスタリングにより、クロス手法耐性が向上し、7種類の最先端GANベースの顔の改ざん手法にわたる一般化が可能になった。
  • グレースケールの偽物マップ出力により、髪の色や目の形の変更といった微細な改ざんの正確なローカライズが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。