Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Face Forgery Detection via Adaptive Learning for Pre-trained Vision Transformer

Anwei Luo, Rizhao Cai|arXiv (Cornell University)|Sep 20, 2023
Face recognition and analysisComputer Science被引用数 3
ひとこと要約

本稿では、事前学習済みのビジョントランスフォーマー(ViT)の知識を保持しつつ、偽造特徴に特化した特徴へ適応するためのパラメータ効率的アプローチである、偽造に気づく適応型ビジョントランスフォーマー(FA-ViT)を提案する。この手法は、局所的アーティファクト検出のための局所的偽造インジェクタ(LFI)と、グローバルドメイン適応のためのグローバル的偽造アダプタ(GFA)の2つのモジュールで構成される。LFIは、周囲を保全するクロスアテンション(NPCA)を用い、GFAはマルチヘッド自己注意(MHSA)層における適応的変換を学習する。FA-ViTは、クロスデータセットおよびクロス操作一般化において最先端の性能を達成し、FaceForensics++では99.60%のAUC、Celeb-DFでは93.83%のAUCを達成した。

ABSTRACT

With the rapid progress of generative models, the current challenge in face forgery detection is how to effectively detect realistic manipulated faces from different unseen domains. Though previous studies show that pre-trained Vision Transformer (ViT) based models can achieve some promising results after fully fine-tuning on the Deepfake dataset, their generalization performances are still unsatisfactory. One possible reason is that fully fine-tuned ViT-based models may disrupt the pre-trained features [1, 2] and overfit to some data-specific patterns [3]. To alleviate this issue, we present a extbf{F}orgery-aware extbf{A}daptive extbf{Vi}sion extbf{T}ransformer (FA-ViT) under the adaptive learning paradigm, where the parameters in the pre-trained ViT are kept fixed while the designed adaptive modules are optimized to capture forgery features. Specifically, a global adaptive module is designed to model long-range interactions among input tokens, which takes advantage of self-attention mechanism to mine global forgery clues. To further explore essential local forgery clues, a local adaptive module is proposed to expose local inconsistencies by enhancing the local contextual association. In addition, we introduce a fine-grained adaptive learning module that emphasizes the common compact representation of genuine faces through relationship learning in fine-grained pairs, driving these proposed adaptive modules to be aware of fine-grained forgery-aware information. Extensive experiments demonstrate that our FA-ViT achieves state-of-the-arts results in the cross-dataset evaluation, and enhances the robustness against unseen perturbations. Particularly, FA-ViT achieves 93.83\% and 78.32\% AUC scores on Celeb-DF and DFDC datasets in the cross-dataset evaluation. The code and trained model have been released at: https://github.com/LoveSiameseCat/FAViT.

研究の動機と目的

  • 限定的なディープフェイクデータにおける継続的忘却と過剰適合のため、ViTベースの顔偽造検出器のクロスデータセット評価における一般化性能が低い問題に対処する。
  • すべての事前学習済みViTパラメータを固定することで、事前学習済みのViTの知識を保持し、パラメータ効率的適応による偽造特化知識の統合を実現する。
  • 適応的特徴学習により、未観測の操作タイプや困難な状況(例:大きなポーズ、悪く光る照明)に対する検出ロバスト性を向上させる。
  • 独自の単一ドメインペアワイズ学習(SDPL)戦略を用いて、真正な顔特徴分布をコンパクト化することで、細粒度特徴学習を強化する。
  • ImageNetレベルの分類と細粒度偽造検出の間のドメインギャップを、グローバルおよびローカルな偽造に気づく適応によって埋める。

提案手法

  • すべての事前学習済みViTパラメータを固定することで、一般視覚表現を保持し、継続的忘却を防ぐ。
  • 局所的偽造インジェクタ(LFI)を導入し、畳み込み的インダクティブバイアスを用いて局所的偽造アーティファクトを捉え、周囲を保全するクロスアテンション(NPCA)を通じてViTに統合する。
  • グローバル的偽造アダプタ(GFA)を設計し、マルチヘッド自己注意(MHSA)層における適応的変換を学習させ、事前学習済み特徴を偽造関連表現に一致させる。
  • LFIおよびGFAにアイデンティティマッピング初期化を実装し、初期出力がほぼゼロになるようにすることで、学習の安定性を向上させる。
  • 単一ドメインペアワイズ学習(SDPL)を提案する。この手法は、背景とポーズは同一だがアイデンティティが異なる真正顔ペアを構築し、真正クラス分類器ベクトルをアンカーとして用いて特徴のコンパクト性を向上させる。
  • Grad-CAM++を用いて注目マップを可視化し、FA-ViTが中央顔面領域ではなく、実際の操作領域(例:口、目)に注目していることを検証する。

実験結果

リサーチクエスチョン

  • RQ1我々は、モデル全体の微調整を伴わず、未観測のデータセットおよび操作タイプにおけるViTベースの顔偽造検出器の一般化性能を向上させることができるか?
  • RQ2事前学習済みViTの一般表現能力を保持しつつ、局所的偽造手がかりを効果的に統合する方法は何か?
  • RQ3自己注意層におけるグローバルな適応的適応は、ImageNet分類と偽造検出の間のドメインギャップをどの程度埋めることができるか?
  • RQ4細粒度真正顔類似性に注目する新しいペアワイズ学習戦略は、特徴のコンパクト性と検出ロバスト性を向上させるか?
  • RQ5本稿で提案するFA-ViTは、大きなポーズや悪く光る照明といった困難な条件下でも、操作領域に高い注目を維持できるか?

主な発見

  • FA-ViTはFaceForensics++(FF++)で99.60%のAUCを達成し、次善のバージョンより0.06%高い性能を示し、クロスデータセット評価において最先端の性能を示した。
  • Celeb-DF(CDF)データセットでは、アイデンティティマッピング初期化なしのバージョン(91.38%)およびベースラインViTを上回る93.83%のAUCを達成した。
  • Wild-Deepfake(WDF)データセットでは、84.32%のAUCを達成し、未観測の操作手法への一般化性能が優れていることが示された。
  • t-SNE可視化により、FA-ViTが異なるデータセットにおいても真正顔がタイトにクラスタリングされていることが確認され、特徴学習のロバスト性と一般化性能が裏付けられた。
  • Grad-CAM++可視化では、FA-ViTが一貫して操作特化領域(例:Face2Faceでは口、Deepfakesでは目)に注目している一方で、ViTはそのようなアーティファクトを局在化できていないことが明らかになった。
  • 除去実験では、LFIおよびGFAにおけるアイデンティティマッピング初期化が極めて重要であることが確認された。この初期化を削除すると、CDFで最大2.5%の性能低下が生じ、学習安定性および特徴の一貫性に寄与していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。