Skip to main content
QUICK REVIEW

[论文解读] Exposing Deep Fakes Using Inconsistent Head Poses

Xin Yang, Yuezun Li|arXiv (Cornell University)|Nov 1, 2018
Digital Media Forensic Detection参考文献 2被引用 22
一句话总结

本文提出了一种利用AI生成图像中面部中心区域与整体面部之间头部姿态不一致性的深度伪造检测方法。通过从面部关键点估计3D头部姿态,并测量基于整体面部与中心区域推导出的姿态之间的差异,该方法将这些差异作为SVM分类器的特征,其在UADFV数据集上达到89%的AUROC,在DARPA GAN Challenge数据集上达到84.3%。

ABSTRACT

In this paper, we propose a new method to expose AI-generated fake face images or videos (commonly known as the Deep Fakes). Our method is based on the observations that Deep Fakes are created by splicing synthesized face region into the original image, and in doing so, introducing errors that can be revealed when 3D head poses are estimated from the face images. We perform experiments to demonstrate this phenomenon and further develop a classification method based on this cue. Using features based on this cue, an SVM classifier is evaluated using a set of real face images and Deep Fakes.

研究动机与目标

  • 为应对AI生成的深度伪造视频和图像对公众造成的误导性威胁。
  • 识别深度伪造生成流程中的内在缺陷,特别是面部关键点的一致性问题。
  • 基于头部姿态估计中的几何不一致性,开发一种稳健且可泛化的检测方法。
  • 评估基于姿态的特征在区分真实与虚假人脸图像方面的有效性。

提出的方法

  • 使用2D面部关键点通过PnP算法结合3D平均人脸模型估计3D头部姿态。
  • 分别使用所有面部关键点(整体面部)和仅中心区域关键点(中心区域)计算头部姿态,然后比较所得的旋转和位移向量。
  • 将两种姿态估计结果之间的差异作为特征向量,包括旋转矩阵差异(R_a - R_c)和位移向量差异(t_a - t_c)。
  • 通过减去均值并除以标准差对特征向量进行标准化,以增强鲁棒性。
  • 使用网格搜索和5折交叉验证,在特征向量上训练带有RBF核的SVM分类器。
  • 使用UADFV和DARPA GAN Challenge数据集中的真实图像/视频帧,通过AUROC评估性能。

实验结果

研究问题

  • RQ1面部中心区域与整体面部之间的头部姿态估计不一致性是否能揭示深度伪造的篡改痕迹?
  • RQ23D头部姿态估计中的几何差异与深度伪造生成伪影之间有何相关性?
  • RQ3在深度伪造检测中,哪种特征表示方式——旋转向量、旋转矩阵或位移差异——最能捕捉姿态不一致性?
  • RQ4该基于姿态的检测方法在UADFV和DARPA GAN Challenge等多样化深度伪造数据集上的表现如何?
  • RQ5结合多种姿态差异特征(旋转与位移)是否能提升检测准确率?

主要发现

  • 该方法在UADFV数据集上实现了0.89的AUROC,表明利用姿态不一致性作为线索具有出色的检测性能。
  • 在DARPA GAN Challenge数据集上,该方法实现了0.843的AUROC,性能较低的原因归因于合成人脸模糊影响关键点检测。
  • 旋转矩阵差异(R_a - R_c)与位移向量差异(t_a - t_c)的组合在帧级分析中实现了最高的AUROC 0.890,在视频级分析中达到0.974。
  • 消融实验证明,加入位移差异显著提升了性能,当在v_a - v_c基础上增加t_a - t_c时,AUROC从0.866提升至0.890。
  • 使用Rodrigues旋转向量(r_a - r_c)使AUROC提升至0.798,而仅使用简化的头部朝向向量时AUROC为0.738。
  • 视频级分类优于帧级分类,当结合R_a - R_c与t_a - t_c时,AUROC达到0.974,表明时间一致性可增强检测效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。