Skip to main content
QUICK REVIEW

[论文解读] When Handcrafted Features and Deep Features Meet Mismatched Training and Test Sets for Deepfake Detection

Ying Xu, Sule Yildirim Yayilgan|arXiv (Cornell University)|Sep 27, 2022
Face recognition and analysis被引用 4
一句话总结

本文在 FaceForensics++ 数据集上评估了手工设计特征(SIFT、HoG)与深度特征(Xception、CNN+RNN)在深度伪造检测中的表现,结果表明:尽管深度模型在训练集与测试集匹配时准确率超过 99%,但当数据分布不匹配时性能急剧下降,凸显了构建通用深度伪造检测系统所面临的严峻挑战。

ABSTRACT

The accelerated growth in synthetic visual media generation and manipulation has now reached the point of raising significant concerns and posing enormous intimidations towards society. There is an imperative need for automatic detection networks towards false digital content and avoid the spread of dangerous artificial information to contend with this threat. In this paper, we utilize and compare two kinds of handcrafted features(SIFT and HoG) and two kinds of deep features(Xception and CNN+RNN) for the deepfake detection task. We also check the performance of these features when there are mismatches between training sets and test sets. Evaluation is performed on the famous FaceForensics++ dataset, which contains four sub-datasets, Deepfakes, Face2Face, FaceSwap and NeuralTextures. The best results are from Xception, where the accuracy could surpass over 99\% when the training and test set are both from the same sub-dataset. In comparison, the results drop dramatically when the training set mismatches the test set. This phenomenon reveals the challenge of creating a universal deepfake detection system.

研究动机与目标

  • 研究手工特征与深度特征在训练集与测试集分布发生偏移时,在深度伪造检测中的鲁棒性。
  • 比较 SIFT、HoG、Xception 与 CNN+RNN 在 FaceForensics++ 基准上,面对不同数据分布时的性能表现。
  • 识别当前深度伪造检测模型在泛化至不同篡改方法(如 Deepfakes、Face2Face、FaceSwap、NeuralTextures)时的局限性。
  • 评估构建一个能够应对多样化合成媒体生成技术的通用深度伪造检测系统的可行性。
  • 探索在领域偏移条件下,特征特异性与泛化能力之间的权衡。

提出的方法

  • 从视频帧中裁剪出的人脸区域提取手工特征,使用 SIFT 和方向梯度直方图(HoG)。
  • 在手工特征上训练支持向量机(SVM)分类器,用于二分类深度伪造检测。
  • 利用预训练的 Xception 模型以及 CNN+RNN 架构从相同的人脸帧中提取深度特征。
  • 在两种设置下评估模型:匹配设置(训练与测试使用同一子数据集)与不匹配设置(训练与测试使用不同子数据集)。
  • 使用 FaceForensics++ 数据集,该数据集包含四个子数据集:Deepfakes、Face2Face、FaceSwap 和 NeuralTextures,每个子数据集包含 1000 个原始视频与 1000 个篡改视频。
  • 采用 75% 训练 / 25% 测试的划分方式,并在训练集中进一步划分为 80% 训练集与 20% 验证集。

实验结果

研究问题

  • RQ1在训练集与测试集匹配的情况下,手工特征(SIFT、HoG)与深度特征(Xception、CNN+RNN)在深度伪造检测准确率上有何差异?
  • RQ2当训练集与测试集来自不同篡改子数据集时,深度伪造检测模型的性能下降程度如何?
  • RQ3为何 Xception 等深度模型在匹配数据上表现优异,但在不匹配数据上却严重失效?
  • RQ4与深度特征相比,手工特征在不同深度伪造生成方法间的泛化能力如何?
  • RQ5在领域偏移条件下,能否基于当前的特征提取与分类方法构建一个通用的深度伪造检测系统?

主要发现

  • 当训练集与测试集来自同一子数据集时,Xception 的准确率超过 99%,表明其在域内检测中表现强劲。
  • Xception 在不匹配测试集上的性能急剧下降,大多数情况下召回率低于 5.00%,表明其在不同篡改类型间泛化能力极差。
  • ResNet-152+LSTM 在匹配数据上达到 88.53% 的准确率,但在不匹配数据上平均准确率仅约 55%,表明其鲁棒性有限。
  • 手工特征(SIFT、HoG)在不匹配数据集上表现出更一致的性能,准确率从 74.26% 下降至 56%,表明其泛化能力优于深度特征。
  • Xception 在不匹配测试集上的召回率在大多数情况下低于 5%,表明其几乎完全无法检测未见过的篡改方法生成的深度伪造。
  • 本研究凸显了一个根本性挑战:当前深度学习模型对特定生成方法高度专业化,难以泛化至新方法,从而严重削弱了通用检测的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。