Skip to main content
QUICK REVIEW

[论文解读] CrossDF: Improving Cross-Domain Deepfake Detection with Deep Information Decomposition

Shanmin Yang, Guo, Hui|arXiv (Cornell University)|Sep 30, 2023
Digital Media Forensic Detection被引用 6
一句话总结

本文提出深度信息分解(DID),一种新颖的框架,通过注意力模块和去相关学习模块,将与深度伪造相关的特征与无关信息(例如,面部表情、伪造技术)分离。通过仅关注深度伪造特异性信号,DID在跨数据集深度伪造检测中实现了最先进性能,提升了对未见伪造方法的鲁棒性和泛化能力。

ABSTRACT

Deepfake technology poses a significant threat to security and social trust. Although existing detection methods have shown high performance in identifying forgeries within datasets that use the same deepfake techniques for both training and testing, they suffer from sharp performance degradation when faced with cross-dataset scenarios where unseen deepfake techniques are tested. To address this challenge, we propose a Deep Information Decomposition (DID) framework to enhance the performance of Cross-dataset Deepfake Detection (CrossDF). Unlike most existing deepfake detection methods, our framework prioritizes high-level semantic features over specific visual artifacts. Specifically, it adaptively decomposes facial features into deepfake-related and irrelevant information, only using the intrinsic deepfake-related information for real/fake discrimination. Moreover, it optimizes these two kinds of information to be independent with a de-correlation learning module, thereby enhancing the model's robustness against various irrelevant information changes and generalization ability to unseen forgery methods. Our extensive experimental evaluation and comparison with existing state-of-the-art detection methods validate the effectiveness and superiority of the DID framework on cross-dataset deepfake detection.

研究动机与目标

  • 解决现有深度伪造检测器在测试数据使用未见伪造技术的跨数据集场景中性能急剧下降的问题。
  • 克服当前方法对特定深度伪造生成方法相关视觉伪影的过拟合问题。
  • 通过将跨数据集检测建模为领域泛化问题,提升检测器的泛化能力。
  • 将面部特征分解为与深度伪造相关和无关的成分,以增强对领域偏移的鲁棒性。
  • 开发一种去相关学习模块,无需事先了解其分布,即可强制实现深度伪造与非深度伪造特征之间的独立性。

提出的方法

  • 使用主干网络(例如,EfficientNet-v2-L)从输入图像中提取初始面部特征。
  • 部署两个注意力模块:深度伪造注意力(A_df)用于识别与深度伪造相关的特征,领域注意力(A_dom)用于捕捉与伪造技术相关的特征。
  • 将特征图分解为深度伪造信息(I_df)和其他信息(I_os),其中仅使用I_df进行真实/伪造分类。
  • 引入去相关学习模块(T),以最小化I_df与I_os之间的相关性,促进特征解耦。
  • 使用结合二元交叉熵(BCE)和受试者工作特征曲线下面积(AUC)的混合损失进行模型训练,以提升泛化能力。
  • 使用领域分类头对伪造技术相关信号分离至非深度伪造成分进行监督。

实验结果

研究问题

  • RQ1将与深度伪造相关的信号与无关信息(例如,面部表情、领域特定伪影)分离,能否提升跨数据集检测的鲁棒性?
  • RQ2在不假设分布的前提下,去相关学习模块在强制实现深度伪造与非深度伪造特征独立性方面的有效性如何?
  • RQ3与低级视觉伪影相比,聚焦于高级语义特征在多大程度上能提升对未见深度伪造技术的泛化能力?
  • RQ4DID框架的各个组件(A_df、A_dom、T)对整体检测性能的贡献如何?
  • RQ5所提出的框架能否在具有挑战性的跨数据集深度伪造检测基准上实现最先进性能?

主要发现

  • DID框架在跨数据集深度伪造检测中实现了0.779的AUC,优于现有最先进方法。
  • 移除领域注意力模块(A_dom)导致AUC下降2.05%(降至0.763),证明其在捕捉与伪造技术相关信号中的关键作用。
  • 移除去相关学习模块(T)导致性能下降更大,AUC降低2.57%(降至0.759),表明其在特征解耦中的核心作用。
  • 领域分类模块的平均准确率达到0.91,FaceSwap的峰值达到0.99,证实了伪造技术信息的有效分离。
  • Grad-CAM可视化显示,深度伪造注意力聚焦于不变的、与伪造相关的线索,而领域注意力则关注区域特定的伪影,验证了特征解耦的有效性。
  • T-SNE可视化证实,DID学习到的深度伪造特征在嵌入空间中分布良好分离,而标准主干网络的特征则呈现真实与伪造样本混合的状态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。