Skip to main content
QUICK REVIEW

[论文解读] ADD: Frequency Attention and Multi-View based Knowledge Distillation to Detect Low-Quality Compressed Deepfake Images

Binh M. Le, Simon S. Woo|arXiv (Cornell University)|Dec 7, 2021
Digital Media Forensic Detection被引用 9
一句话总结

本文提出 ADD,一种知识蒸馏框架,通过利用频率注意力蒸馏和多视角注意力蒸馏,提升低质量(LQ)压缩深度伪造检测性能。通过将教师模型在高质量数据上训练所得的高频和相关特征表示知识,迁移至在低质量数据上训练的学生模型,ADD 实现了最先进性能,在压缩深度伪造数据集上检测准确率最高提升 7.1%。

ABSTRACT

Despite significant advancements of deep learning-based forgery detectors for distinguishing manipulated deepfake images, most detection approaches suffer from moderate to significant performance degradation with low-quality compressed deepfake images. Because of the limited information in low-quality images, detecting low-quality deepfake remains an important challenge. In this work, we apply frequency domain learning and optimal transport theory in knowledge distillation (KD) to specifically improve the detection of low-quality compressed deepfake images. We explore transfer learning capability in KD to enable a student network to learn discriminative features from low-quality images effectively. In particular, we propose the Attention-based Deepfake detection Distiller (ADD), which consists of two novel distillations: 1) frequency attention distillation that effectively retrieves the removed high-frequency components in the student network, and 2) multi-view attention distillation that creates multiple attention vectors by slicing the teacher's and student's tensors under different views to transfer the teacher tensor's distribution to the student more efficiently. Our extensive experimental results demonstrate that our approach outperforms state-of-the-art baselines in detecting low-quality compressed deepfake images.

研究动机与目标

  • 为解决检测低质量压缩深度伪造图像的严峻挑战,此类图像因细粒度伪影丢失,导致现有深度伪造检测器性能下降。
  • 在带宽和存储受限环境中提升检测鲁棒性,此类环境普遍使用压缩图像。
  • 利用知识蒸馏(KD)将高质量(HQ)教师模型中的判别性特征迁移至在低质量(LQ)数据上训练的轻量化学生模型。
  • 通过新型注意力机制,特别恢复丢失的高频分量并保持压缩图像中的像素级相关性。
  • 开发一种对不同压缩级别具有鲁棒性且能跨多种深度伪造生成方法泛化的蒸馏框架。

提出的方法

  • 引入频率注意力蒸馏,通过教师模型的高频特征导出的注意力图,引导学生网络恢复并聚焦于图像压缩过程中丢失的高频分量。
  • 多视角注意力蒸馏利用切片 Wasserstein 距离,将学生模型的特征分布与教师模型在多个张量切片上的分布对齐,保留特征间相关性。
  • 在统一的知识蒸馏框架中整合两种蒸馏组件,使学生模型从教师模型的特征中同时学习频率模式与空间相关性模式。
  • 该框架兼容多种主干网络架构(如 ResNet18、ResNet34、EfficientNet-B0),支持灵活部署。
  • 蒸馏损失结合特征级知识迁移与对比学习,以增强特征判别力与泛化能力。
  • 方法通过频率与多视角注意力损失的加权组合进行端到端训练,采用标准反向传播进行优化。

实验结果

研究问题

  • RQ1知识蒸馏能否有效恢复低质量压缩深度伪造图像中丢失的高频伪影,从而提升检测准确率?
  • RQ2多视角注意力蒸馏如何增强教师与学生网络在压缩图像检测中相关像素特征的迁移能力?
  • RQ3将频率与多视角注意力蒸馏相结合,是否能相比单模态蒸馏在检测高度压缩深度伪造图像时产生协同增益?
  • RQ4所提方法在不同深度伪造生成方法(如 NeuralTextures、FaceSwap、Face2Face)和不同压缩级别(如 c23、c40)下是否具备鲁棒性?
  • RQ5该方法在仅在低质量数据上训练的学生模型中,是否能显著降低过拟合与注意力错位现象?

主要发现

  • 在 EfficientNet-B0 主干网络上,ADD 在检测压缩深度伪造图像时实现 7.1% 的准确率增益,优于所有五个测试数据集的基线模型。
  • 在 ResNet50 主干网络上,ADD 在 NeuralTextures 数据集上的检测准确率达到 68.53%,显著高于基线模型的 60.27%。
  • 结合对比学习的多视角注意力蒸馏相比非对比学习变体性能提升 1.11%,证明了更优特征分布对齐的益处。
  • 该方法在不同压缩级别(c23 与 c40)下均表现出一致的性能增益,表明对图像质量变化具有鲁棒性。
  • Grad-CAM 可视化结果表明,ADD 正确引导学生模型注意力聚焦于面部区域,抑制背景噪声,而基线模型则激活非面部区域。
  • 该方法对超参数 α(频率注意力权重)与 β(多视角注意力权重)不敏感,不同取值下性能均保持显著优越。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。