[论文解读] On Improving Cross-dataset Generalization of Deepfake Detectors
本文提出了一种混合监督-强化学习框架,通过在测试时应用图像特定的测试时数据增强,以提升深度伪造检测在跨数据集场景下的泛化能力。通过使用强化学习智能体为每张测试图像选择前-k 个增强操作,并对它们的基于卷积神经网络(CNN)的分类分数进行平均,该方法在 Celeb-DF 上实现了 0.669 的 SOTA AUC,显著优于基线 CNN 模型和现有方法在跨数据集评估中的表现。
Facial manipulation by deep fake has caused major security risks and raised severe societal concerns. As a countermeasure, a number of deep fake detection methods have been proposed recently. Most of them model deep fake detection as a binary classification problem using a backbone convolutional neural network (CNN) architecture pretrained for the task. These CNN-based methods have demonstrated very high efficacy in deep fake detection with the Area under the Curve (AUC) as high as 0.99. However, the performance of these methods degrades significantly when evaluated across datasets. In this paper, we formulate deep fake detection as a hybrid combination of supervised and reinforcement learning (RL) to improve its cross-dataset generalization performance. The proposed method chooses the top-k augmentations for each test sample by an RL agent in an image-specific manner. The classification scores, obtained using CNN, of all the augmentations of each test image are averaged together for final real or fake classification. Through extensive experimental validation, we demonstrate the superiority of our method over existing published research in cross-dataset generalization of deep fake detectors, thus obtaining state-of-the-art performance.
研究动机与目标
- 为解决基于 CNN 的深度伪造检测器在跨数据集评估中因领域偏移导致的显著性能下降问题。
- 提升深度伪造检测模型在图像质量与生成技术各异的多样化数据集之间的鲁棒性与可迁移性。
- 通过在测试时学习自适应的、图像特定的数据增强策略,减轻领域偏移的影响。
- 实现在跨数据集深度伪造检测泛化任务中的 SOTA 性能。
提出的方法
- 训练一个强化学习(RL)智能体,基于学习到的策略为每张测试图像选择前-k 个数据增强操作。
- RL 智能体使用 Q 表或策略网络(例如 PPO)选择能最大化预期奖励的增强操作,奖励定义为检测置信度的提升。
- 对每张测试图像,生成多个增强版本,并对其基于 CNN 的分类分数进行平均以获得最终预测结果。
- 该方法在模型训练完成后应用,因此与任何预训练的 CNN 主干网络(例如 EfficientNet V2-L、XceptionNet)兼容。
- RL 智能体在源数据集(例如 FaceForensics++)上进行训练,随后无需进一步微调即可应用于目标数据集(例如 Celeb-DF、DeeperForensics-1.0)。
- 该方法实现了图像特定的增强选择,能够根据每张输入图像的视觉质量和伪造特征进行自适应调整。
实验结果
研究问题
- RQ1由强化学习引导的测试时数据增强是否能提升深度伪造检测器在跨数据集场景下的泛化能力?
- RQ2图像特定的增强选择策略是否优于随机或固定增强策略,从而更有效地减轻领域偏移的影响?
- RQ3为最大化跨数据集检测性能,最优的增强数量(k)是多少?
- RQ4在某一数据集上学习到的策略是否能有效泛化到具有不同深度伪造生成技术的未见数据集?
主要发现
- 所提方法在 Celeb-DF 上实现了 0.669 的 AUC,比基线 CNN 提升了 0.018,证明其在跨数据集评估中达到了 SOTA 性能。
- 前 3 个增强操作表现最佳,在 FaceForensics++ 上 AUC 达 0.994,在 Celeb-DF 上 AUC 达 0.669,表明最优 k=3。
- 该方法将 Celeb-DF 上的 EER 降低至 0.362,相比基线 CNN 下降了 0.021,显示出更强的鲁棒性。
- 消融实验证实,系统化的 RL 增强选择策略优于随机或固定增强策略。
- 在 FaceForensics++ 上学习到的策略能有效泛化到 Celeb-DF 和 DeeperForensics-1.0,证实了其在不同数据集间的可迁移性。
- 即使在数据集内 AUC 高达 0.994,基线 CNN 在 Celeb-DF 上的性能仍骤降至 0.482,凸显了跨数据集泛化能力的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。