Skip to main content
QUICK REVIEW

[论文解读] Towards Generalizable and Robust Face Manipulation Detection via Bag-of-local-feature

Changtao Miao, Qi Chu|arXiv (Cornell University)|Mar 14, 2021
Face recognition and analysis参考文献 27被引用 7
一句话总结

该论文提出了一种新颖的面部伪造检测方法,利用局部特征增强的Transformer模型,在无显式监督的情况下学习局部伪造特征,显著提升了在跨数据集和真实世界扰动下的泛化能力和鲁棒性。该方法在FaceForensics++、Celeb-DF和DeeperForensics-1.0上均取得了最先进性能,即使在不使用额外数据或掩码监督的情况下也优于现有方法。

ABSTRACT

Over the past several years, in order to solve the problem of malicious abuse of facial manipulation technology, face manipulation detection technology has obtained considerable attention and achieved remarkable progress. However, most existing methods have very impoverished generalization ability and robustness. In this paper, we propose a novel method for face manipulation detection, which can improve the generalization ability and robustness by bag-of-local-feature. Specifically, we extend Transformers using bag-of-feature approach to encode inter-patch relationships, allowing it to learn local forgery features without any explicit supervision. Extensive experiments demonstrate that our method can outperform competing state-of-the-art methods on FaceForensics++, Celeb-DF and DeeperForensics-1.0 datasets.

研究动机与目标

  • 解决现有面部伪造检测方法在跨数据集和真实世界扰动下泛化能力有限、鲁棒性不足的问题。
  • 通过学习细微且与图像块相关的局部伪造特征,而非依赖全局图像统计特征,来提升检测性能。
  • 开发一种自监督、端到端的方法,避免昂贵的数据增强或掩码监督信号。
  • 证明视觉Transformer在小型、特定任务数据集(如面部伪造检测)上的有效性。

提出的方法

  • 将输入的面部图像划分为非重叠的图像块,形成局部图像块的集合。
  • 使用卷积层将每个图像块嵌入为特征向量,形成局部特征袋表示。
  • 添加可学习的一维位置嵌入,以保留图像块之间的空间关系。
  • 应用带有自注意力机制的Transformer编码器,建模图像块之间的相互关系,并学习具有判别性的局部伪造模式。
  • 仅使用分类损失进行端到端训练,不依赖对伪造区域的任何监督信号。
  • 通过关注面部图像中不同局部图像块之间的不一致性,隐式捕捉细微的伪造痕迹。

实验结果

研究问题

  • RQ1基于局部特征袋的Transformer是否能在不显式监督伪造区域的情况下,学习到具有判别性的伪造特征?
  • RQ2当仅在FaceForensics++上进行训练时,该方法在未见数据集Celeb-DF上的泛化能力如何?
  • RQ3与现有SOTA方法相比,该方法在图像失真和噪声等真实世界扰动下的鲁棒性如何?
  • RQ4视觉Transformer是否能有效应用于小规模、特定任务的面部伪造检测数据集,而无需微调或额外数据?

主要发现

  • 在FaceForensics++上,该方法在Celeb-DF(V1)上达到82.52%的AUC,在Celeb-DF(V2)上达到78.26%,尽管未使用时序信息或额外数据,仍优于Face X-ray和Two-branch方法。
  • 在标准DF-1.0测试集上,该方法准确率达到93.53%,比Xception高出5.15%,在混合失真条件下仍保持优异性能(准确率87.06%)。
  • 注意力可视化结果表明,模型聚焦于眼睛、嘴巴和嘴唇等伪造区域,而非背景或未修改区域。
  • 该方法在所有评估基准上均超越了最先进模型,包括跨数据集泛化能力和真实世界扰动下的鲁棒性,且无需依赖掩码监督或合成数据。
  • 消融实验表明,局部特征袋设计显著提升了性能,尤其在检测细微局部伪造痕迹方面。
  • 结果表明,视觉Transformer可在极少归纳偏置和无伪造区域显式监督的情况下,有效适配面部伪造检测任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。