Skip to main content
QUICK REVIEW

[论文解读] Generalized Face Forgery Detection via Adaptive Learning for Pre-trained Vision Transformer

Anwei Luo, Rizhao Cai|arXiv (Cornell University)|Sep 20, 2023
Face recognition and analysisComputer Science被引用 3
一句话总结

本文提出了一种伪造感知自适应视觉Transformer(FA-ViT),一种参数高效的面部伪造检测方法,在保留预训练视觉Transformer(ViT)知识的同时,通过两个模块实现对伪造特征的适应:用于局部伪影检测的局部感知伪造注入器(LFI),其采用邻域保持交叉注意力(NPCA);以及用于全局领域自适应的全局感知伪造适配器(GFA)。FA-ViT在跨数据集和跨伪造方法的泛化性能上达到当前最优水平,在FaceForensics++上达到99.60%的AUC,在Celeb-DF上达到93.83%。

ABSTRACT

With the rapid progress of generative models, the current challenge in face forgery detection is how to effectively detect realistic manipulated faces from different unseen domains. Though previous studies show that pre-trained Vision Transformer (ViT) based models can achieve some promising results after fully fine-tuning on the Deepfake dataset, their generalization performances are still unsatisfactory. One possible reason is that fully fine-tuned ViT-based models may disrupt the pre-trained features [1, 2] and overfit to some data-specific patterns [3]. To alleviate this issue, we present a extbf{F}orgery-aware extbf{A}daptive extbf{Vi}sion extbf{T}ransformer (FA-ViT) under the adaptive learning paradigm, where the parameters in the pre-trained ViT are kept fixed while the designed adaptive modules are optimized to capture forgery features. Specifically, a global adaptive module is designed to model long-range interactions among input tokens, which takes advantage of self-attention mechanism to mine global forgery clues. To further explore essential local forgery clues, a local adaptive module is proposed to expose local inconsistencies by enhancing the local contextual association. In addition, we introduce a fine-grained adaptive learning module that emphasizes the common compact representation of genuine faces through relationship learning in fine-grained pairs, driving these proposed adaptive modules to be aware of fine-grained forgery-aware information. Extensive experiments demonstrate that our FA-ViT achieves state-of-the-arts results in the cross-dataset evaluation, and enhances the robustness against unseen perturbations. Particularly, FA-ViT achieves 93.83\% and 78.32\% AUC scores on Celeb-DF and DFDC datasets in the cross-dataset evaluation. The code and trained model have been released at: https://github.com/LoveSiameseCat/FAViT.

研究动机与目标

  • 解决基于ViT的面部伪造检测器在跨数据集评估中因灾难性遗忘和在有限Deepfake数据上过拟合而导致的泛化能力差的问题。
  • 通过冻结其参数来保留预训练ViT的知识,同时利用参数高效的微调方式注入伪造特异性知识。
  • 通过自适应特征学习提升对未见伪造类型和挑战性条件(如大姿态、光照差)的检测鲁棒性。
  • 通过一种新颖的单域成对学习(SDPL)策略,压缩真实人脸特征分布,以增强细粒度特征学习。
  • 通过全局与局部伪造感知自适应,弥合ImageNet级别分类与细粒度伪造检测之间的领域差距。

提出的方法

  • 冻结所有预训练ViT参数,以保留其通用视觉表征并防止灾难性遗忘。
  • 引入局部感知伪造注入器(LFI),利用卷积归纳偏置捕捉局部伪造伪影,并通过邻域保持交叉注意力(NPCA)将其注入ViT。
  • 设计全局感知伪造适配器(GFA),在多头自注意力(MHSA)层中学习自适应变换,使预训练特征与伪造相关表征对齐。
  • 在LFI和GFA中采用身份映射初始化,通过确保初始输出接近零来稳定训练过程。
  • 提出单域成对学习(SDPL),构建共享背景和姿态但身份不同的细粒度真实人脸对,利用真实类别分类器向量作为锚点,以优化特征紧凑性。
  • 使用Grad-CAM++可视化注意力图,验证FA-ViT聚焦于实际伪造区域(如嘴部、眼部)而非面部中心区域。

实验结果

研究问题

  • RQ1我们能否在不微调整个模型的前提下,提升基于ViT的面部伪造检测器在未见数据集和伪造类型上的泛化能力?
  • RQ2如何在保留其通用表征能力的同时,有效将局部伪造线索注入预训练ViT?
  • RQ3在自注意力层中进行全局自适应适配,能在多大程度上弥合ImageNet分类与伪造检测之间的领域差距?
  • RQ4一种强调细粒度真实人脸相似性的新型成对学习策略,是否能提升特征紧凑性与检测鲁棒性?
  • RQ5在大姿态或光照差等挑战性条件下,所提出的FA-ViT能否保持对伪造区域的高注意力聚焦?

主要发现

  • FA-ViT在FaceForensics++(FF++)上达到99.60%的AUC,优于次优变体0.06%,在跨数据集评估中表现当前最优。
  • 在Celeb-DF(CDF)数据集上,FA-ViT达到93.83%的AUC,显著优于未使用身份映射初始化的变体(91.38%)和基线ViT。
  • 在Wild-Deepfake(WDF)数据集上,FA-ViT达到84.32%的AUC,展现出对未见伪造方法的强大泛化能力。
  • t-SNE可视化结果表明,FA-ViT在不同数据集上均保持了真实人脸的紧密聚类,表明其具备鲁棒且通用的特征学习能力。
  • Grad-CAM++可视化显示,FA-ViT始终聚焦于特定伪造区域(如Face2Face的嘴部、Deepfakes的眼部),而ViT则无法准确定位此类伪影。
  • 消融实验表明,LFI与GFA中均采用身份映射初始化至关重要——移除该机制后,CDF数据集上的性能下降最高达2.5%,表明其在训练稳定性和特征一致性方面具有关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。