[论文解读] Deep Face Forgery Detection
本文提出了一种基于迁移学习和时序建模的深度学习方法,用于检测面部视频伪造。通过在 VGGFace2 数据集上预训练的 Inception ResNet V1 模型进行微调,并利用 3D-CNN 和 Bi-LSTM 架构对相邻帧进行多帧分析,该方法在 FaceForensics++ 基准测试中实现了最先进(SOTA)的准确率,尤其在检测高度压缩的 NeuralTextures 伪造视频方面表现突出。
Rapid progress in deep learning is continuously making it easier and cheaper to generate video forgeries. Hence, it becomes very important to have a reliable way of detecting these forgeries. This paper describes such an approach for various tampering scenarios. The problem is modelled as a per-frame binary classification task. We propose to use transfer learning from face recognition task to improve tampering detection on many different facial manipulation scenarios. Furthermore, in low resolution settings, where single frame detection performs poorly, we try to make use of neighboring frames for middle frame classification. We evaluate both approaches on the public FaceForensics benchmark, achieving state of the art accuracy.
研究动机与目标
- 提升在多种伪造方法(包括 FaceSwap、DeepFakes、Face2Face 和 NeuralTextures)下面部视频伪造的检测准确率。
- 解决在高度压缩视频中检测伪造内容的挑战,特别是针对由 NeuralTextures 生成的、对人类和模型均具挑战性的视频。
- 利用面部识别的迁移学习提升在低数据量或新型伪造方法上的泛化能力和性能。
- 通过建模多个连续帧的时序一致性,利用时序建模增强单帧分类性能,超越仅依赖单帧分析的方法。
提出的方法
- 通过在 VGGFace2 面部识别数据集上预训练的 Inception ResNet V1 模型进行微调,应用迁移学习以提升伪造检测的特征学习能力。
- 采用经过修改的 Inception ResNet V1 架构进行单帧分类,使用 MTCNN 从视频中裁剪出人脸帧,替代原始的 dlib 面部检测器。
- 对于时序建模,采用三维卷积神经网络(3D-CNN),其中通过共享 2D CNN 编码器的权重,将连续帧的特征图堆叠形成 3D 输入。
- 同时评估了使用 2D CNN 编码器的 Bi-LSTM 模型作为 3D-CNN 的替代方案,其性能相当但参数更少。
- 在 7 帧窗口(中间帧前后各 3 帧)上执行多帧分类,中间帧通过集成学习或序列建模进行分类。
- 模型在 Tesla V100 GPU 上使用 Adam 优化器进行训练,训练过程中应用数据增强和类别平衡策略。
实验结果
研究问题
- RQ1从面部识别预训练任务进行迁移学习是否能显著提升在多种伪造方法下的面部伪造检测性能?
- RQ2在低分辨率或高度压缩的视频设置中,引入相邻帧的时序上下文是否能提升检测准确率?
- RQ3在建模帧间序列依赖关系用于伪造检测时,3D-CNN 与 Bi-LSTM 架构的性能表现如何比较?
- RQ4仅在 NeuralTextures 上训练的模型在多大程度上能泛化到其他伪造方法和压缩级别?
- RQ5时序建模是否有助于检测如 c40 压缩级别下 NeuralTextures 的细微伪造痕迹?
主要发现
- 所提方法在 FaceForensics++ 基准测试中实现了最先进性能,无论在整体准确率还是在检测具有挑战性的 NeuralTextures 伪造方面均优于以往方法。
- 在 VGGFace2 上微调的 Inception ResNet V1 模型在 NeuralTextures 与原始序列的 c40 压缩级别下达到 77.7% 的测试准确率,优于基线模型和 3D-CNN 模型。
- 使用 2D CNN 编码器的 Bi-LSTM 模型实现了与 3D-CNN 模型相同的 77.7% 平均准确率,但参数量显著更少,表明具有更高的效率。
- 仅在 c40 压缩级别的 NeuralTextures 上训练的模型在相同压缩级别下达到 75.3% 的准确率,但在其他伪造方法(尤其是 FaceSwap 和 DeepFakes)上泛化能力较差。
- c40 压缩级别的性能低于 c23 或原始压缩级别,表明高比例压缩会降低检测性能,但该模型在该场景下仍优于基线方法。
- 3D-CNN 和 Bi-LSTM 模型均优于多数投票基线,证明时序建模能够捕捉超越独立帧分类的有用模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。