[论文解读] Robust Attentive Deep Neural Network for Exposing GAN-generated Faces
本文提出了一种稳健的、端到端的注意力深度学习框架,通过分析双眼角膜镜面高光中的不一致性来检测 GAN 生成的人脸。采用结合二元交叉熵与基于 WMW 统计量的 AUC 优化的联合损失函数的残差注意力网络(RAN),该方法在平衡与非平衡数据集上均实现了最先进性能,包括新创建的 FFHQ-GAN 基准数据集,同时通过注意力图提供了可解释的检测结果。
GAN-based techniques that generate and synthesize realistic faces have caused severe social concerns and security problems. Existing methods for detecting GAN-generated faces can perform well on limited public datasets. However, images from existing public datasets do not represent real-world scenarios well enough in terms of view variations and data distributions (where real faces largely outnumber synthetic faces). The state-of-the-art methods do not generalize well in real-world problems and lack the interpretability of detection results. Performance of existing GAN-face detection models degrades significantly when facing imbalanced data distributions. To address these shortcomings, we propose a robust, attentive, end-to-end network that can spot GAN-generated faces by analyzing their eye inconsistencies. Specifically, our model learns to identify inconsistent eye components by localizing and comparing the iris artifacts between the two eyes automatically. Our deep network addresses the imbalance learning issues by considering the AUC loss and the traditional cross-entropy loss jointly. Comprehensive evaluations of the FFHQ dataset in terms of both balanced and imbalanced scenarios demonstrate the superiority of the proposed method.
研究动机与目标
- 解决现有 GAN 人脸检测方法在真实世界数据不平衡条件下泛化能力不足与可解释性差的问题。
- 提升在真实人脸远多于生成人脸的非平衡数据集上的检测性能。
- 开发一种可解释的方法,通过眼区的物理不一致性(特别是角膜镜面高光)识别 GAN 生成的人脸。
- 设计一种可微分损失函数,有效优化非平衡学习场景下的 AUC。
- 创建一个新的基准数据集 FFHQ-GAN,用于在真实数据分布条件下评估 GAN 人脸检测。
提出的方法
- 使用 Mask R-CNN 定位并提取人脸图像中的虹膜区域。
- 采用残差注意力网络(RAN)自动学习并定位双眼之间角膜镜面高光的不一致性。
- 设计一种联合损失函数,结合标准二元交叉熵损失与通过 Wilcoxon-Mann-Whitney(WMW)统计量松弛的 ROC-AUC 损失,以提升在非平衡数据上的优化效果。
- 采用端到端训练,联合优化特征学习与检测任务,使用组合损失。
- 利用 RAN 的注意力图提供可解释性,突出显示感兴趣区域(如不一致的镜面高光)。
- 在新构建的 FFHQ-GAN 数据集上验证方法,包含平衡与非平衡的数据划分。
实验结果
研究问题
- RQ1眼级不一致性(特别是角膜镜面高光)是否可作为检测 GAN 生成人脸的可靠且可解释的线索?
- RQ2如何使深度学习模型在真实人脸远多于生成人脸的 GAN 人脸检测中具备对数据不平衡的鲁棒性?
- RQ3结合交叉熵与通过 WMW 统计量优化 AUC 的联合损失函数是否相比仅使用标准交叉熵能提升非平衡数据集上的检测性能?
- RQ4端到端的注意力模型是否能优于传统 CNN 在检测 GAN 生成人脸中的细微伪影?
- RQ5所提出方法在存在视角变化与非正脸姿态的真实世界场景中,其泛化能力如何?
主要发现
- 所提出的 RAN 模型采用 BCE + AUC(通过 WMW)损失,在 FFHQ-GAN 数据集的平衡与非平衡版本中,所有指标(准确率、AUC、F1、召回率)均达到最高性能。
- 在非平衡的 FFHQ-GAN 数据集上,该模型达到 0.92 的召回率,显著优于 ResNet-50 和 Xception(召回率均低于 0.70)。
- 消融实验表明,联合 BCE + AUC 损失相比仅使用 BCE 训练性能更优,非平衡集上的 AUC 分数提升了 5.2%。
- 损失函数中的最优超参数 α 确定为 0.4,在所有测试值中实现了最佳 AUC 表现。
- 注意力图可视化显示,模型在伪造人脸中的角膜镜面高光区域集中注意力,而在真实人脸中的注意力则更广泛分布于虹膜区域,证实其学习到相关伪影的能力。
- 该方法成功检测到非正脸与侧视图像中的 GAN 生成人脸,表明对姿态变化具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。